必须勾选「同步生成高精度字幕(含标点与停顿)」选项,否则不触发asr识别链路;声音克隆需上传方言测试句校准,公共音色遇专业术语须括号注音;导出前须选硬字幕或srt、设延迟补偿-120ms、字体大小为屏幕高度4.2%。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要让百度一镜生成的数字人视频自动带字幕,而不是后期手动加——尤其当批量产出泛知识类口播视频时,字幕同步率低会导致观众跳出率升高,而人工校对又吃掉30%以上制作时间。
确认视频生成流程中已启用语音识别模块
进入百度一镜控制台 →「数字人视频」→「新建项目」→ 选择「AI驱动视频创作引擎」模板 → 在「内容输入」环节上传文案或直接粘贴文本后,页面右上角会出现【语音合成设置】按钮;点击展开,必须勾选「同步生成高精度字幕(含标点与停顿)」选项,否则后续所有步骤均不会触发字幕生成流程。
这一步不可跳过。未勾选时系统默认仅输出音频波形,不启动ASR识别链路,即使视频里数字人口型精准,字幕轨道也为空。
使用声音克隆素材时需额外校准发音特征
方法一:若你已上传真人录音用于声音克隆(如10分钟清晰语音),在完成克隆后进入「声音复刻」详情页 → 点击「发音校准」→ 上传3段含典型方言词、连读、吞音的测试句(例如“这事儿咱得赶紧办”“差不多得了”),系统将据此优化语音识别模型对你的声纹适配度。
方法二:若使用平台公共库声音(如“新闻男声-沈涛”),无需校准,字幕生成准确率默认达98.7%,但遇到专业术语(如“非线性编辑器DaVinci Resolve”)需在文案中用括号标注拼音,否则识别可能误为“大梵西”。
【关键前提】字幕生成依赖语音合成阶段的真实发音输出,而非原始文案文本。若跳过TTS合成直接导出静音视频,字幕功能将完全失效。
导出前强制触发字幕渲染与样式绑定
第一步:完成数字人视频预览无误后,点击右上角「导出设置」→ 在「输出格式」中选择MP4或MOV → 展开「字幕选项」→ 勾选「嵌入硬字幕(Burn-in)」或「生成SRT文件」;二者不可同时选,硬字幕无法后期修改,SRT可导入剪辑软件调整位置。
第二步:点击「高级参数」→ 将「字幕延迟补偿」滑块拖至-120ms(适用于百度自研Zeroshot TTS模型),此值能消除口型启动与语音起始间的微秒级偏差,避免字幕比嘴动慢半拍。
第三步:确认「字幕样式」中字体大小设为屏幕高度的4.2%,行间距1.8倍——这是经大河报实测验证的移动端最佳可读阈值,小于3.8%在iPhone SE上会看不清,大于4.5%则遮挡数字人眼部微表情。
最后点击「立即生成」,系统将在视频编码完成的同时,同步输出带时间轴的字幕流。











