可通过三种方式实现智谱清影数字人方言语音:一、用智谱清言情感语音生成方言音频后导入清影;二、调用glm-tts api指定方言参数生成兼容音频再驱动清影;三、结合glm-tts与ying api双通道合成口型精准的方言视频。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望智谱清影数字人输出方言语音,但当前界面未显示方言选项或生成结果仍为普通话,则可能是由于清影主流程默认绑定标准语音模型,且方言能力尚未在图生视频/文生视频前端直接开放。以下是实现方言播报效果的可行路径:
一、通过智谱清言端到端情感语音功能调用方言TTS
智谱清言已上线支持粤语、东北话等方言的端到端情感语音技术,该能力与清影同属智谱AI技术栈,可生成高拟真度方言语音片段,再导入清影驱动唇形同步。
1、更新智谱清言APP至最新版本,确保已启用“情感语音”开关。
2、在对话框中输入目标方言短句,例如“今朝天气真系好啊”,并点击右下角语音按钮触发合成。
3、在语音设置中手动选择粤语(广州话)或东北话音色,调节语速与情感强度至适配数字人形象。
4、播放确认无误后,点击下载按钮保存MP3文件,该音频可作为清影视频生成的外部音源输入。
二、使用GLM-TTS API指定方言参数生成语音
GLM-TTS模型支持通过API请求显式指定语言与方言标签,开发者可绕过前端限制,直接调用底层接口获取方言语音数据,再注入清影工作流。
1、访问bigmodel.cn平台,开通GLM-TTS服务权限,并查阅文档确认可用方言代码,如zh-yue(粤语)、zh-dongbei(东北话)。
2、构造POST请求体,在text字段填入方言文本,language字段设为zh-yue,voice字段匹配对应方言音色ID。
3、发送请求获取base64编码语音响应,解码后保存为WAV格式,确保采样率与清影兼容(推荐16kHz单声道)。
4、在清影图生视频高级设置中启用“音频驱动”模式,上传该WAV文件,系统将自动对齐唇动与方言语音节奏。
三、结合清影Ying API与方言语音双通道合成
面向批量生产需求,可通过程序化方式将方言语音与清影视频生成解耦再融合:先由GLM-TTS生成方言音频,再以该音频为输入调用Ying API生成口型精准匹配的视频帧序列。
1、调用GLM-TTS API生成目标方言签名语音,获取音频URL或base64数据。
2、调用Ying API的/video_from_audio接口,将音频数据传入audio_input字段,同时在prompt中强调“嘴唇动作需严格匹配粤语发音口型特征”。
3、设置output_format为mp4,resolution为1080p,确保输出视频具备高清唇形细节与自然面部微动。
4、接收返回的视频URL,下载后即可获得原生支持方言播报的数字人视频成品。











