回归科技
手记 / 使用教程

字幕转录 安装与使用

把外语影片的对白转成字幕,可选翻译成中文,全程在本机运行不联网。本文讲清楚每个选项是什么意思、该怎么选。

⚑ 使用教程 2026-09-06 约 12 分钟 v0.9 内测版 王知风
内测中

这个工具还在 v0.9 内测,功能可用但仍在调整,参数和界面可能变。 现在看到这页的人就是内测用户 —— 用下来有问题、有想加的功能, 进 QQ 群 说一声, 改起来很快。文末「当前状态」列了已知还没做的几项。

一分钟速览
01 这是什么

能做什么,不能做什么

输入一段视频或音频,输出可以直接用的字幕文件。中间可以在同一个窗口里边看边改,最后导出 SRT,或者把字幕直接封进视频。

英文、日文影片转字幕,可选翻译成简体中文。
播放原片核对字幕,4K H.265 也能满帧播放。
逐条修改文字和时间,改完立刻在画面上看到效果。
导出纯原文、双语、纯中文三种 SRT,或合并成带字幕的 MKV。
不做说话人区分,字幕里不标是谁在说。
不做硬字幕烧录,导出的是软字幕,播放器里可开可关。
不做批量排队,一次处理一个文件。
0运行期网络请求
1.00x4K H.265 预览播放实时倍率
3可选的本地翻译模型
N 卡硬性配置要求
字幕转录 v0.9 王知风 · huigui.ai 素材 选择视频或音频… HEVC 3840x2160 · 42 分钟 语言 英语 趟数 3 ☑ 转录完自动翻译成中文 Seed-X-7B 开始转录 时间轴 字幕早于人声就往右拖,秒出 But you haven't even seen the view yet. 但你连景色都没看过呢。 42:10 开始 结束 字幕文本 中文 05:12.4 05:14.8 Okay, that's nice. 好吧,挺不错。 05:15.2 05:18.0 But you haven't even seen… 但你连景色都没看过呢。 05:18.6 05:20.1 mm hmm (语气词,跳过) 05:21.0 05:23.4 I have a quick question. 我有个问题。
示意图 · 一个窗口里完成全部工作:左栏设参数,右上播原片核对,右下逐条改。橙色是模型没把握的句子,紫色高亮行跟着播放自动滚动。

配置要求

项目要求
系统Windows 10 / 11 64 位
显卡必须 NVIDIA。显存 8GB 以上体验最好
显存不足时程序自动改用体积更小的翻译模型,不会硬跑
硬盘整合包解压后约 20GB
网络运行时完全不需要
02 启动与转录

从拖入文件到拿到字幕

1

双击 启动.bat,等桌面窗口打开。第一次启动要加载模型,会慢一些。

2

把视频拖进窗口,或点「选择视频或音频」。左边会显示这个文件的编码、分辨率、时长和码率。

3

选「语言」—— 填的是片子里说的是什么语言,不是你想要什么语言。英文片选英语。

4

选「趟数」,默认 3 趟。含义见下一节。

5

点「开始转录」。进度条下面会显示当前跑到第几趟、第几个窗口。

全程在一个窗口里,中间不用切换软件 拖入视频 选语言和趟数 转录 最耗时的一步 核对修改 边播边改,自动存 翻译中文 可选,能换模型 导出 SRT 或 MKV 中断了能接着跑 这两步都是秒级,改完立刻在画面上看到 同一个文件下次打开,上次的结果(含译文)自动读回,不用重跑
示意图 · 转录是唯一耗时的环节,长片可以中途关掉,下次接着跑。
那个黑色命令行窗口不要关

它是程序的输出窗口,出错信息会打在里面。界面卡住或报错时,先看这个窗口里最后几行写了什么。

03 趟数

决定漏不漏话的那个选项

趟数 = 同一段音频从头到尾识别几遍

为什么要跑多遍:识别模型内部带随机采样,同一句话这一遍听出来了,下一遍可能整句吞掉。这不是音质问题,也不是设置问题,是模型本身的特性。跑多遍再把每遍的结果合到一起,漏掉的就补回来了。

实测同一段素材:只跑一遍时,I can't breatheStop itYes please 这些完整句子整句没有出现;跑三遍后,识别出的不重复实词多了 15 个。

111.wav · 五分钟真实素材
同一段音频,同一个模型,只差跑几遍 只跑 1 趟 Stop it I can't breathe Yes please 虚线处整句没有出现 —— 不是听不清,是这一遍恰好吞掉了 跑 3 趟取并集 第 1 趟 第 2 趟补上 第 3 趟补上 后面的趟只往空白处填,不覆盖已经对的内容
示意图 · 数据来自 111.wav 五分钟真实素材的实测:单趟漏掉三个完整句子,三趟后去重实词多 15 个。
趟数适用场景
1 趟先快速看看效果,或者片子很长想省时间
3 趟默认,推荐。绝大多数情况用这个
4–5 趟说话含混、背景音大,或者特别在意不能漏话
多跑几趟不会让结果变差

合并时会挑质量最好的那一趟当底稿,其余趟只往时间空白处补,不会覆盖已经识别对的内容。所以趟数只增不减,代价只有时间:3 趟就是 1 趟的三倍时长。

长片跑到一半关了不会白跑

转录过程每隔几个窗口自动存一次进度。下次打开同一个文件会接着上次的位置往下跑。换了文件、改了语言或趟数,进度会作废重新开始 —— 那已经是另一件事了。

04 核对与修改

边看边改

转录完,右边是播放器,下面是字幕表。播放时当前这句会自动高亮并滚动过去,字幕同时叠在画面上。

操作作用
单击某一行视频跳到那一刻
双击文字或时间直接编辑。时间填错会自动改回去
在当前时间拆分把当前播放位置所在的那条切成两条
合并选中按住 Ctrl 或 Shift 多选,并成一条
删除选中删掉不要的行

改完自动保存,不用手动点。关窗口前也会再存一次。同一个文件下次打开,上次的结果(包括译文)会自动读回来,不用重跑。

只看低置信

勾上这个,表格里只显示模型自己没把握的句子,这些句子在表格里也标成橙色。核对时优先看这些,性价比最高 —— 剩下的多半是对的。

时间轴偏移

字幕比人说话早或晚时用这个滑块,往右拖 = 字幕延后。拖完点「套用偏移」,立刻生效,不需要重新转录。默认值是与商业字幕逐条比对 32 句后测出来的,一般不用动。

快捷键

按键作用
空格播放 / 暂停(点画面也可以)
← →快退 / 快进 3 秒
Ctrl + ← →跳到上一句 / 下一句
M静音
F11 或双击画面剧场模式(只留画面),Esc 退出
Ctrl + F定位到搜索框,中英文都能搜
Ctrl + S保存字幕
05 翻译成中文

三个本地模型,各有强弱

勾「转录完自动翻译成中文」,或者先转录、回头再点「翻译成中文」。翻译同样在本机跑,不联网。

下拉框里可以换模型。翻得不满意可以换一个重新翻,不用重新转录 —— 三个模型的出错方式不一样,往往换一个就对了。

模型体积特点
Seed-X-7B7.0 GB默认。口语和俚语最准,速度最快。偶尔会把整句意思弄拧
Qwen3-4B3.8 GB整句意思更稳不跑偏,但用词偏保守
NLLB-600M0.6 GB又小又快,质量明显差一截。显存很小时的兜底

程序启动时会按空闲显存自动挑一个装得下的。装不下的模型在下拉里会标出「显存不足」,选了会提示你换小的 —— 不会硬跑,因为硬跑会退到 CPU,慢到看着像卡死。

为什么不用在线翻译

在线接口质量确实更好,但要把影片内容上传到第三方服务器,而且整合包的前提是断网也能用。所以全部改成本地模型,代价是质量差一些、体积大一些。

为了时间轴准确,一句话常被切成三条 and I know that your assistant had said you're going to be shooting ① 合成整句再翻,逐条翻会不成话 and I know that your assistant had said you're going to be shooting ② 有上下文才知道 shooting 是拍摄不是开枪 我知道你助理说过你要开拍了 ③ 按比例切回原来每一条,时间轴一点不动 我知道 你助理说过 你要开拍了
示意图 · 切分点优先落在中文标点上;译文明显偏短会判定模型吞了内容,自动改成逐条翻译补上。
字幕被切碎了还能翻好吗

能。为了时间轴准确,一句话经常被切成两三条,逐条翻会不成话。程序会先把碎片合成整句、整句翻译、再把中文按比例切回原来每一条,时间轴一点不动。译文明显偏短时会判定模型吞了内容,自动改成逐条翻译补上。

06 导出

SRT 与合并视频

导出 SRT

如果翻译过,点一次会同时生成三份

文件内容
片名.srt只有原文
片名.双语.srt原文 + 中文,一条两行
片名.中文.srt只有中文
点一次「导出 SRT」,同时得到这三份 片名.srt 纯原文 12 00:05:15,200 --> 00:05:18,000 But you haven't even seen the view yet. 13 00:05:21,000 --> 00:05:23,400 I have a quick question. 想自己翻译时用这份 片名.双语.srt 推荐 12 00:05:15,200 --> 00:05:18,000 But you haven't even seen the view yet. 但你连景色都没看过呢。 13 00:05:21,000 --> 00:05:23,400 I have a quick question. 我有个问题。 一条两行,对照着看 片名.中文.srt 纯中文 12 00:05:15,200 --> 00:05:18,000 但你连景色都没看过呢。 13 00:05:21,000 --> 00:05:23,400 我有个问题。 只想看中文时用这份
示意图 · 三份的时间码完全一致,随时可以换着用。纯语气词那种没有译文的条目,在纯中文版里会跳过,不留空字幕。

放到视频同一个文件夹、改成同名,大部分播放器会自动加载。

合并导出视频

把字幕封进视频,导出 .mkv画质完全无损 —— 只是把字幕装进容器,视频本身一帧都不重新压缩,所以很快。播放时可以在播放器里开关字幕。

✅ 常见问题排查
·启动就报错,说找不到显卡 — 本工具必须 NVIDIA 显卡。确认显卡型号和驱动版本,核显和 A 卡不支持。
·识别不出连续的语气词 — 正常。这类纯语气词本来就不强求,中间夹着的正常对白才是重点,翻译时也会跳过它们。
·字幕比人说话早或晚 — 拖「时间轴偏移」滑块,点「套用偏移」。秒出,不重跑。
·有几句翻得完全不对 — 在下拉里换个翻译模型重翻一次。三个模型的错法不一样。
·下拉里某个模型写着「显存不足」 — 你的显存装不下它,选小一点的。程序启动时已经自动挑过一次。
·转录很慢 — 趟数调成 1 试试。另外第一次启动要加载模型,之后会快很多。
·长片跑到一半关了 — 重新打开同一个文件会接着上次的位置跑,不会从头再来。
·视频播放卡顿 — 检查是不是在虚拟机或远程桌面里运行,那两种环境拿不到显卡硬解。
·担心片子被上传 — 运行期零联网。模型全在整合包目录内,断网可以正常使用。界面上的网址只是署名。
07 版本

当前状态

当前是 v0.9 内测版。功能可用但仍在调整,参数和界面可能变化。以下几项还没做,列出来免得误会:

日语的时长计算和语气词识别还没适配,效果不如英文。
低音量耳语识别率偏低,还没做专门处理。
批量排队还没做。
来源与说明

文中的数据(趟数对比、播放实时倍率、翻译模型差异)均来自实际素材的逐条测试记录,不是估算值。测试机为 RTX 5070 Ti / Windows 11,其他配置的表现可能不同。

有问题?进群问一句

装包报错、工具答疑,QQ 群里人多手快;深入 Agent 实战的问题,PRO 群当天有答案。

查看社群 →