可灵ai生成口播视频需先确认数字人状态并开启高级模式,再选择音频或文本驱动,精准调节自然度参数,最后勾选去水印导出无痕视频。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用可灵AI快速生成一段口播视频,不需要真人出镜、不用剪辑软件、不花一分钱买设备,只要一段文案+一个数字人就能出片。但很多人卡在“人物张嘴不自然”“声音和嘴型对不上”“生成后像机器人念稿”这三步上,根本原因是没走对驱动路径或参数没调准。
确认数字人可用并开启高级模式
这一步跳过,后续所有操作都会失败。进入「我的分身」页面,检查目标数字人头像右下角是否显示绿色【可用】标签;若为灰色“待审核”或红色“失效”,需重新上传正脸照并等待人工审核通过(通常2小时内)。
点击右上角齿轮图标→勾选「高级模式」→页面左上角出现“人物驱动”按钮才算激活成功。未开启高级模式时,即使上传音频或粘贴文本,驱动面板也不会显示。
准备驱动源:音频 or 文本?
音频驱动更精准,适合已有配音文件、需复刻特定语气节奏的场景;文本驱动更灵活,适合写好口播稿直接生成全流程内容。
方法一:用音频驱动
准备一段10–60秒的纯净人声MP3或WAV文件,单声道、16kHz采样率、无背景音乐、无剪辑断点。手机录音后务必用Audacity删掉首尾2秒静音段,否则系统会误判起始点导致嘴型错位。
方法二:作文本驱动
文案必须是简体中文口语化表达,每句≤6秒长度,避免“综上所述”“因此可见”等书面连接词。例如把“本产品具备三大核心优势”改成“它有三个厉害的地方:第一……第二……第三……”。【禁用中英文混排符号如“/”“-”“@”,会导致TTS引擎崩溃】
执行人物驱动并调节自然度参数
第一步:点击左侧工具栏「人物驱动」按钮,切换至配置面板。
第二步:根据驱动源类型,点击「上传音频」或「输入文本」页签。
第三步:音频用户上传文件后,务必点击「试听驱动效果」——只听声音+口型模拟,不渲染画面。若发现张嘴延迟明显或闭嘴过早,立即返回调整音频起始静音段,直到波形首个能量峰与首音节完全对齐。
第四步:文本用户粘贴文案后,在「音色选择」中必须指定含「Viseme-Optimized」后缀的音色(如Lingyun (Emotion-Enhanced)),再勾选「启用动态唇部微调」与「强制对齐音素边界」。这两项不勾选,嘴型就是机械开合,毫无微表情变化。
第五步:点击「生成配音」,等待进度条跑完。此时系统同步输出语音波形与口型动画帧序列,不是单纯合成音频。
导出无水印口播视频
生成完成后,预览窗口下方出现「下载MP4(H.265/1080p/60fps)」按钮。
点击前务必勾选「去除平台水印」选项——该选项默认关闭,不勾选则导出视频右下角带可灵LOGO,且无法后期擦除。
点击下载,文件自动保存至浏览器默认下载目录,命名含时间戳与数字人名称,可直接用于抖音、视频号、公众号发布。











