首帧图需作为角色“数字身份证”严格准备:①用midjourney生成含具体人脸特征的定妆照;②导出png并清除透明通道与icc配置文件;③手机相册原图导出以剥离exif冗余数据。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

用可灵AI做图生视频时,人物在不同镜头里突然变脸、五官错位、发型漂移、衣服颜色跳变——这些问题不是模型“抽风”,而是参考图没用对、提示词没锁死、关键参数被默认值悄悄绕过。
上传首帧图前必须做好的三件事
首帧图不是随便截一张就能用。它得是角色的“数字身份证”,否则后续所有生成都在猜。
第一步:用Midjourney或即梦生成一张正面半身定妆照,提示词必须含具体人脸特征,例如:“Portrait of a 28-year-old Han Chinese woman, heart-shaped face, double eyelid, slight upturn at outer eye corners, small freckle on right cheekbone, shoulder-length wavy brown hair, wearing ivory knitted turtleneck, soft studio lighting, clean white background”。
第二步:导出PNG格式,分辨率不低于1024×1024,用Photoshop检查是否带透明通道或嵌入ICC配置文件——【若有,必须删除,否则可灵会误读色彩空间导致肤色偏移】。
第三步:把这张图拖进手机相册再原图导出一次,目的是剥离EXIF中的拍摄设备、GPS、时间戳等冗余元数据——可灵部分版本会因读取这些字段触发异常重采样。
图生视频界面的关键设置
进入可灵Web端→点击「图生视频」→上传刚准备好的首帧图后,立刻执行以下操作:
关闭「智能背景增强」和「自动光影匹配」两项开关——它们会强行重绘人物边缘与明暗交界线,直接破坏面部结构稳定性。
将「运动强度(Motion Scale)」手动设为5.2~6.8区间——低于5动作僵硬,高于7.0极易引发手指/耳垂/发梢等高频细节崩坏;这个范围是实测中肩颈过渡与微表情保留率最高的安全带。
勾选「保持原始构图比例」并锁定「宽高比=1:1」——哪怕你最终要输出16:9,也先在这里固定,否则模型会在每帧重新计算人物在画面中的锚点位置,造成轻微漂移累积。
提示词写法:只准动“动作”和“环境”,其余全部冻结
方法一:基础冻结法
提示词严格按此结构书写:
[Same person as input image] → [动作:缓步向左平移两步,右手自然下垂,左手轻抚腰侧] → [环境:浅灰水泥地面,顶部柔光灯带,无窗无装饰]。
注意:“Same person as input image”必须作为第一短语,且不能加任何修饰词,不能换行,不能前置“Film still of…”之类描述。
方法二:动态锚点法(适合有运镜需求)
在动作描述中插入不可删减的物理约束短语,例如:“右脚跟始终接触地面→左膝弯曲角度维持在28°±3°→头部水平旋转不超过11°”。
【这类角度数值必须来自首帧图中用标尺工具量出的真实数据,凭感觉写的数字会让模型彻底放弃一致性】。
生成后必做的帧间校验
① 把生成视频导入Premiere,打开“放大器”效果,将缩放倍数调至400%,逐帧检查左眼瞳孔高光位置是否偏移超过3像素;
② 截取第1帧、第12帧、第24帧(对应0s、0.5s、1s),用Photopea叠图模式设为“差值”,观察面部区域是否出现大面积灰色噪点——有则说明三维表征未锁定;
③ 拖动时间轴到人物抬手最高点,暂停,用吸管工具点击她右手食指尖,记录RGB值;再跳到第36帧(1.5s)同一位置,RGB偏差>8即判定为材质闪烁,需回退启用三维结构锁定。











