字幕转录 安装与使用
把外语影片的对白转成字幕,可选翻译成中文,全程在本机运行不联网。本文讲清楚每个选项是什么意思、该怎么选。
这个工具还在 v0.9 内测,功能可用但仍在调整,参数和界面可能变。 现在看到这页的人就是内测用户 —— 用下来有问题、有想加的功能, 进 QQ 群 说一声, 改起来很快。文末「当前状态」列了已知还没做的几项。
- 双击
启动.bat打开桌面窗口,拖入视频即可开始,不需要命令行。 - 模型全部在整合包内,运行期零联网,片子不会离开你的电脑。
- 必须是 NVIDIA 显卡。A 卡、核显、无独显的机器跑不了。
- 「趟数」是本工具最容易被忽略的选项 —— 它决定漏不漏话,不是画质开关。
- 转录、核对、翻译、导出在同一个窗口里完成,改完自动存盘,长片中断后能接着跑。
能做什么,不能做什么
输入一段视频或音频,输出可以直接用的字幕文件。中间可以在同一个窗口里边看边改,最后导出 SRT,或者把字幕直接封进视频。
配置要求
| 项目 | 要求 |
|---|---|
| 系统 | Windows 10 / 11 64 位 |
| 显卡 | 必须 NVIDIA。显存 8GB 以上体验最好 |
| 显存不足时 | 程序自动改用体积更小的翻译模型,不会硬跑 |
| 硬盘 | 整合包解压后约 20GB |
| 网络 | 运行时完全不需要 |
从拖入文件到拿到字幕
双击 启动.bat,等桌面窗口打开。第一次启动要加载模型,会慢一些。
把视频拖进窗口,或点「选择视频或音频」。左边会显示这个文件的编码、分辨率、时长和码率。
选「语言」—— 填的是片子里说的是什么语言,不是你想要什么语言。英文片选英语。
选「趟数」,默认 3 趟。含义见下一节。
点「开始转录」。进度条下面会显示当前跑到第几趟、第几个窗口。
它是程序的输出窗口,出错信息会打在里面。界面卡住或报错时,先看这个窗口里最后几行写了什么。
决定漏不漏话的那个选项
趟数 = 同一段音频从头到尾识别几遍。
为什么要跑多遍:识别模型内部带随机采样,同一句话这一遍听出来了,下一遍可能整句吞掉。这不是音质问题,也不是设置问题,是模型本身的特性。跑多遍再把每遍的结果合到一起,漏掉的就补回来了。
实测同一段素材:只跑一遍时,
111.wav · 五分钟真实素材I can't breathe、Stop it、Yes please这些完整句子整句没有出现;跑三遍后,识别出的不重复实词多了 15 个。
| 趟数 | 适用场景 |
|---|---|
| 1 趟 | 先快速看看效果,或者片子很长想省时间 |
| 3 趟 | 默认,推荐。绝大多数情况用这个 |
| 4–5 趟 | 说话含混、背景音大,或者特别在意不能漏话 |
合并时会挑质量最好的那一趟当底稿,其余趟只往时间空白处补,不会覆盖已经识别对的内容。所以趟数只增不减,代价只有时间:3 趟就是 1 趟的三倍时长。
转录过程每隔几个窗口自动存一次进度。下次打开同一个文件会接着上次的位置往下跑。换了文件、改了语言或趟数,进度会作废重新开始 —— 那已经是另一件事了。
边看边改
转录完,右边是播放器,下面是字幕表。播放时当前这句会自动高亮并滚动过去,字幕同时叠在画面上。
| 操作 | 作用 |
|---|---|
| 单击某一行 | 视频跳到那一刻 |
| 双击文字或时间 | 直接编辑。时间填错会自动改回去 |
| 在当前时间拆分 | 把当前播放位置所在的那条切成两条 |
| 合并选中 | 按住 Ctrl 或 Shift 多选,并成一条 |
| 删除选中 | 删掉不要的行 |
改完自动保存,不用手动点。关窗口前也会再存一次。同一个文件下次打开,上次的结果(包括译文)会自动读回来,不用重跑。
只看低置信
勾上这个,表格里只显示模型自己没把握的句子,这些句子在表格里也标成橙色。核对时优先看这些,性价比最高 —— 剩下的多半是对的。
时间轴偏移
字幕比人说话早或晚时用这个滑块,往右拖 = 字幕延后。拖完点「套用偏移」,立刻生效,不需要重新转录。默认值是与商业字幕逐条比对 32 句后测出来的,一般不用动。
快捷键
| 按键 | 作用 |
|---|---|
空格 | 播放 / 暂停(点画面也可以) |
← → | 快退 / 快进 3 秒 |
Ctrl + ← → | 跳到上一句 / 下一句 |
M | 静音 |
F11 或双击画面 | 剧场模式(只留画面),Esc 退出 |
Ctrl + F | 定位到搜索框,中英文都能搜 |
Ctrl + S | 保存字幕 |
三个本地模型,各有强弱
勾「转录完自动翻译成中文」,或者先转录、回头再点「翻译成中文」。翻译同样在本机跑,不联网。
下拉框里可以换模型。翻得不满意可以换一个重新翻,不用重新转录 —— 三个模型的出错方式不一样,往往换一个就对了。
| 模型 | 体积 | 特点 |
|---|---|---|
| Seed-X-7B | 7.0 GB | 默认。口语和俚语最准,速度最快。偶尔会把整句意思弄拧 |
| Qwen3-4B | 3.8 GB | 整句意思更稳不跑偏,但用词偏保守 |
| NLLB-600M | 0.6 GB | 又小又快,质量明显差一截。显存很小时的兜底 |
程序启动时会按空闲显存自动挑一个装得下的。装不下的模型在下拉里会标出「显存不足」,选了会提示你换小的 —— 不会硬跑,因为硬跑会退到 CPU,慢到看着像卡死。
在线接口质量确实更好,但要把影片内容上传到第三方服务器,而且整合包的前提是断网也能用。所以全部改成本地模型,代价是质量差一些、体积大一些。
能。为了时间轴准确,一句话经常被切成两三条,逐条翻会不成话。程序会先把碎片合成整句、整句翻译、再把中文按比例切回原来每一条,时间轴一点不动。译文明显偏短时会判定模型吞了内容,自动改成逐条翻译补上。
SRT 与合并视频
导出 SRT
如果翻译过,点一次会同时生成三份:
| 文件 | 内容 |
|---|---|
片名.srt | 只有原文 |
片名.双语.srt | 原文 + 中文,一条两行 |
片名.中文.srt | 只有中文 |
放到视频同一个文件夹、改成同名,大部分播放器会自动加载。
合并导出视频
把字幕封进视频,导出 .mkv。画质完全无损 —— 只是把字幕装进容器,视频本身一帧都不重新压缩,所以很快。播放时可以在播放器里开关字幕。
当前状态
当前是 v0.9 内测版。功能可用但仍在调整,参数和界面可能变化。以下几项还没做,列出来免得误会:
文中的数据(趟数对比、播放实时倍率、翻译模型差异)均来自实际素材的逐条测试记录,不是估算值。测试机为 RTX 5070 Ti / Windows 11,其他配置的表现可能不同。