可灵ai通过人物驱动功能实现文本或音频到自然口播视频的转换,包含文本驱动、音频驱动及参考嘴型视频校准三种方式,分别支持内置tts同步唇动、本地音频精准对齐及物理一致性增强。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已拥有可灵AI中的人物图像或数字人模型,但尚未生成具备自然口播效果且嘴型同步的视频,则需通过人物驱动功能将文本或音频转化为语音,并实时绑定唇部动画。该过程涵盖文本转语音合成、音频波形驱动、音素-视位映射及帧级延迟补偿等关键环节。以下是具体操作路径:
一、使用文本驱动生成口播并同步嘴型
该方式由可灵AI内置TTS引擎直接将中文文案转为语音,并同步生成匹配的唇部动作,适用于标准资讯播报、课程讲解等场景,无需外部音频文件。
1、进入可灵AI「创建作品」页面,点击右上角齿轮图标启用「高级模式」。
2、在左侧工具栏点击「人物驱动」按钮,切换至驱动配置面板,选择「输入文本」页签。
3、在文本框中粘贴简体中文口播文案,确保每句≤6秒、主谓宾结构清晰,避免“综上所述”“鉴于”等书面连接词。
4、在「音色选择」中指定标注为「中文(普通话)」且含「Viseme-Optimized」后缀的音色,例如Xiaoqiu (Multilingual)或Lingyun (Emotion-Enhanced)。
5、勾选「启用动态唇部微调」与「强制对齐音素边界」,点击「生成配音」,系统同步输出语音波形与口型动画帧序列。
二、上传本地音频驱动嘴型同步
当您已有专业录制的口播音频时,可通过音频驱动方式实现更高精度的嘴型还原,系统基于波形能量分布与音素切分结果,强制数字人复现对应唇动轨迹。
1、准备单声道WAV格式音频,采样率16kHz、位深度16bit,无背景噪声、削波失真与爆音。
2、在「人物驱动」面板中切换至「上传音频」页签,点击「从本地选择」上传该文件。
3、上传完成后,系统自动解析音素时序并显示波形能量分布图;确认首音节起始点与首个能量峰对齐。
4、进入「高级校准」面板,将「唇动幅度」调节至0.65–0.78区间,将「口型响应延迟」设为-80ms以抵消渲染链路固有延迟。
5、点击「开始同步」,等待处理完成,生成带精准唇部动作的新视频轨道。
三、结合参考嘴型视频校准物理一致性
针对需高度还原真实讲话风格的IP数字人,可利用其本人高清正面讲话视频提取运动包络,覆盖模型默认预测偏差,提升唇部微表情可信度与物理一致性。
1、截取目标人物3秒连续说话片段(需包含/a/、/e/、/i/、/o/、/u/五种元音),保存为MP4(H.264编码,1080p)。
2、在可灵AI「校准工具」中上传该视频,点击「提取嘴部运动包络」,系统生成12维唇部关键点时序曲线。
3、将导出的.csv曲线文件拖入当前项目「驱动覆盖区」,勾选「覆盖下颌垂直位移」与「嘴角水平拉伸」两项。
4、重新运行合成,此时AI仅保留原始音频的音素序列,其余唇部运动完全按参考视频包络执行。











