必须先降噪再重传,否则切片文案无法修正;需勾选whisper-large-v3-accurate模型并启用专业术语词典;人工校准转写后保存才能启动智能拆解。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用天工AI拆解一段2小时的行业访谈视频,但上传后发现自动生成的字幕文字模糊、错字连篇、标点混乱,导致切片文案全靠猜——问题不在语音本身,而在于天工AI对低质语音的转写模块未被主动触发优化。
确认视频音轨是否达标
打开天工AI网页端(tiangong.cn),登录后进入【视频智能拆解】页面,找到已上传的视频条目,点击右侧“详情”图标。页面底部会显示音轨检测报告,若出现“语音信噪比<12dB”或“存在持续背景噪音”提示,【必须先做降噪再重传】,否则后续所有切片文案都会基于错误语音文本生成,无法靠后期编辑修正。
这一步操作起来很简单,直接把文件拖进去就行。
若原始视频是微信转发来的MP4,大概率已被压缩两轮以上,人声频段衰减严重,此时不能直接上传,需先在剪映中用“智能降噪→人声增强→均衡器拉高2kHz–4kHz”三步预处理,再导出为H.264编码、比特率≥5Mbps的新文件上传。
强制启用高精度语音转写模型
上传新视频后,在启动分析前,务必勾选两项关键选项:
① 打开“高级设置”下拉菜单 → 选择“语音转写模型:Whisper-large-v3-accurate”(该模型专为中文会议/访谈场景微调,识别率比默认模型高27%);
② 勾选“启用专业术语词典”,然后在弹出框中粘贴本次访谈涉及的10–15个核心名词(如“LP结构化基金”“IRR倒挂”“GP跟投机制”),每个词占一行,不加引号、不带解释。
注意:如果漏掉这一步,AI会把“IRR”识别成“阿姨”,把“LP”听成“L P空格”,且无法在后续文案编辑中批量替换——因为时间戳和语音片段已绑定,改文字不联动改定位。
人工校准转写结果再生成切片
等待90秒后,页面弹出转写稿预览窗口,此时不要急着点“开始拆解”。
先通读前3分钟逐句字幕,重点核对数字、英文缩写、人名和专业术语。发现错误立即点击错字→右键→“修正为:XXX”,系统会实时更新该时间点的语音特征向量,供后续切片分析复用。
方法一:用Ctrl+F快速定位所有“的”“地”“得”混用处,统一改为“的”——天工AI当前版本对助词敏感度低,混用会导致语义断点偏移。
方法二:对连续超过8秒无标点的长句,手动插入逗号或句号,每处修改后按Enter确认。这能显著提升AI对语义停顿的判断准确率,避免把一句完整观点切成两个无效片段。
全部校准完成后,点击右上角【保存并启动智能拆解】,系统将基于修正后的语音文本重新运行语义断点与情绪标注算法。











