即梦ai对口型需精准匹配角色类型与音频特性:上传图片限用大师/快速模式(音频≤30秒),视频仅支持基础模式;真人图须正脸无遮挡,卡通图需嘴部清晰;标准模式只动唇、耗分少,生动模式增微动作但强制1:1裁切,大师模式需视频源且首测免费1次;音频上传忌爆音静音,文案生成按每字0.25秒估算时长,务必试听断句与重音。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想让一张静态数字人图片开口说话,又不想花光每天66~100个免费积分,还希望口型自然、动作不僵硬——即梦AI的对口型设置必须精准匹配角色类型和音频特性,否则生成视频会卡顿、裁剪严重或嘴唇完全不同步。
上传角色前的关键准备
先确认你手里的素材是图片还是视频:上传图片只能用「大师模式」或「快速模式」,但两者都强制限制音频≤30秒;上传视频则必须选「基础模式」,且视频本身不能超过30秒——超时会直接弹窗报错,无法继续。
真人照片务必正脸、无遮挡、光照均匀,侧脸或戴口罩会导致口型偏移;卡通/古风图需确保嘴部区域清晰可辨,模糊边缘会让AI误判唇形开合节奏。
如果用即梦自动生成的图片,生成时就在「图片3.0Pro」模型下勾选【智能参考】,能大幅提升后续对口型时的面部一致性,避免同一人物在不同片段中脸型突变。
三种生成效果模式怎么选
标准模式:只动嘴唇,不动眉毛、眼睛、头部角度。适合新闻播报、知识口播类内容,生成快、耗积分少(2~5分/次),【上传图片后默认进入此模式,但必须手动确认】。
生动模式:增加眨眼、微点头、嘴角牵动等小动作,更适合唱歌、情绪化台词。注意:该模式会强制裁切为1:1画幅,原图若为3:4或16:9,人物肩膀、手部大概率被切掉。
大师模式:启用OmniHuman-1全身动态模型,支持站姿微移、手势、呼吸起伏。仅限新注册账号首测免费1次,后续单次消耗≥48积分,且必须上传视频作为角色源——图片上传后该选项置灰不可点。
音频输入的两种路径与限制
方法一:上传本地音频文件
点击【音频】→【上传配音】,支持MP3/WAV格式,单次上限10MB/36秒。注意:音频开头0.3秒内不能有爆音或静音过长,否则首帧口型会延迟半拍,后期难修正。
方法二:用文案生成音频
点击【生成音频】→粘贴文本(≤120汉字)→选音色→调语速。这里有个隐藏规则:即梦按每字≈0.25秒估算时长,所以120字理论最长30秒,但实际生成常压缩到27秒左右,预留3秒缓冲更稳妥。
特别提醒:无论哪种方式,生成前务必点击右上角「试听」图标,确认语音断句合理、重音位置符合表达意图——AI不会理解潜台词,它只忠实地把“啊”“嗯”“呃”也当成有效发音同步口型。
开始生成并规避常见失败
第一步:检查「角色」已成功加载,右上角显示缩略图且无红叹号
第二步:核对「生成效果」是否为你选定的模式,尤其防止误留在生动模式导致裁切
第三步:音频源确认无误后,点击【生成视频】按钮
第四步:等待进度条走完,生成页面出现预览窗口时,拖动时间轴逐帧查看第1秒、第8秒、结尾3秒的唇形匹配度
如果发现明显不同步(比如语音说“你好”时嘴巴还在闭合状态),不要直接下载,点「重新生成」并切换音色——同一文案换用“女声-亲切”可能比“女声-知性”口型贴合度高20%,这是即梦当前版本的音色底层映射差异所致。











