可灵ai数字人功能支持用静态人像图+文本或音频生成自然口型同步的1080p短视频,需电脑端v3.0.2+版本、正面清晰人像及合规驱动源。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让一张静态照片里的人物开口说话,生成一段自然口型同步、带语音播报的短视频,可灵AI数字人功能正好支持这个需求——它不要求你有视频拍摄设备或剪辑经验,只需一张清晰人像图加一段文案或音频,就能在几分钟内产出1080p/48FPS、最长60秒的说话视频。
确认是否满足基础条件
可灵AI数字人功能目前仅对电脑端v3.0.2+版本开放,手机App和网页版暂不支持。如果你用的是旧版客户端,【必须先卸载重装最新版】,否则点击“人物驱动”按钮后界面会直接报错或空白。
该功能依赖图像中人脸结构的完整识别,上传的照片需满足:正面或微侧脸(左右偏转不超过30°)、双眼清晰可见、无口罩/墨镜/大面积遮挡、背景干净不杂乱。侧脸过大会导致口型驱动失败,系统不会提示原因,只会生成静止画面。
准备驱动源:文本 or 音频?
方法一:用文字生成语音并驱动口型(适合口播稿、产品介绍)
在「输入文本」框中粘贴已校对的口语化文案,例如:“大家好,这是我们新上线的夏日限定芒果冰,采用当季台农芒现打,奶香浓郁不腻口。”
注意删掉所有括号注释、英文缩写和顿号分隔的并列短语,AI对这类标点理解不稳定,容易造成口型卡顿。
方法二:用真人录音驱动口型(适合复刻声音、方言播报)
上传WAV或MP3格式音频,时长严格控制在10–60秒之间;音频开头必须有至少0.3秒静音段,否则系统会截断首字发音;采样率建议为44.1kHz,低于32kHz会导致唇形抖动。
执行人物驱动操作
第一步:进入「创建作品」页面→点击右上角齿轮图标→开启「高级模式」。
第二步:在编辑区左侧工具栏找到并点击「人物驱动」按钮,界面自动跳转至配置面板。
第三步:上传你的照片——拖入一张1024×1024 PNG/JPG格式人像图,系统会在3秒内完成面部关键点定位并显示绿色锚点框。
第四步:切换到对应标签页(「输入文本」或「上传音频」),填入/导入驱动源。
第五步:点击「生成视频」,等待约70–120秒,预览画布将逐帧渲染出带口型动作的视频流。











