需用whisper.cpp生成英文文本,再通过subtitleedit自动对齐并合并中英字幕:先导出跃问ai的subtitle_zh.srt和未剪辑audio.mp3;用whisper.cpp转录得audio.txt;在subtitleedit中导入中文srt和audio.txt,执行音频波形自动同步,再合并为双语srt,保存为utf-8 with bom编码。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要为AI生成的视频快速配上准确的中英双语字幕,但跃问AI导出的字幕文件只有中文SRT,没有英文时间轴对齐版本——必须借助第三方工具完成双语同步,且不能手动逐行调整时间码。
准备跃问AI导出的原始字幕与音频
在跃问AI网页端完成视频生成后,点击右上角「导出」→「字幕(SRT)」,下载得到subtitle_zh.srt;同时点击「导出」→「仅音频(MP3)」,保存为audio.mp3。这两份文件缺一不可,【音频必须是原始生成时未裁剪、未变速的版本】,否则后续时间轴会整体偏移。
把两个文件放在同一个空文件夹里,比如命名为video_project,不要改名,也不要放进子文件夹。
用Whisper.cpp本地生成英文转录
下载预编译好的Whisper.cpp Windows/macOS/Linux版本(推荐v1.29.0+),解压后进入bin目录。
将audio.mp3复制到该bin目录下,打开终端(macOS/Linux)或命令提示符(Windows),执行:
✅ 五大心智模型(M1-M5)全保留 ✅ 四层建筑法(L1-L4)完整表格化 ✅ @多模态绑定语法优先级表 ✅ 20+ 场景诊断表(问题/原因/修复/边界) ✅ 八大行业模板(都配了完整提示词示例) ✅ 诚实能力边界表 ✅ Agent 触发关键词 + 标准入参/出参 ✅ 表达 DNA 固定风格
./main -m models/ggml-base.en.bin -f audio.mp3 -otxt -osep
这行命令调用英文基础模型,输出纯文本格式(-otxt)并启用句子分割(-osep),能提升断句合理性。等待2~5分钟,生成audio.txt——它不含时间戳,只含英文原文,每行一句。
用SubtitleEdit对齐中英字幕时间轴
第一步:用SubtitleEdit打开跃问导出的subtitle_zh.srt;
第二步:菜单栏选择「工具」→「翻译」→「从文本文件导入翻译」;
第三步:在弹窗中勾选「按行匹配」,点击「浏览」选中刚生成的audio.txt,确认导入;
第四步:点击「同步」→「自动同步(基于音频波形)」,软件会分析audio.mp3与当前字幕的时间起点,微调全部时间码使中文字幕帧精准贴合原声;
第五步:再次点击「同步」→「合并双语」→「中文在上,英文在下」,生成带换行的双语SRT。
注意:如果导入英文文本后出现某段缺失,说明audio.txt行数与中文SRT条目数不一致——此时要回到Whisper.cpp命令末尾加上-l en -t 0重新运行,强制按原始中文分段节奏切英文句。
导出兼容主流播放器的双语SRT
在SubtitleEdit中按Ctrl+S保存,文件名建议用video_zh-en.srt;
导出前务必检查「文件」→「另存为」→ 编码选UTF-8 with BOM;
播放测试:用VLC打开视频,加载该SRT,按L键切换字幕轨道,确认中英两行均完整显示、无乱码、无延迟。










