可灵ai多图参考生视频需用电脑版v3.0.2+、视频1.3模型,上传2–4张同一主体的1024×1024 jpg/png图,配精准动词提示词,4秒生成并校验中间帧。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已有一张或多张参考图片,并希望可灵AI基于这些图像生成连贯动态视频,则需确保图片符合格式、分辨率与语义一致性要求。以下是完成多图参考生成视频的具体操作路径:
一、确认多图参考功能支持范围与前提条件
多图参考生成视频功能专用于提升人物形象一致性、动作逻辑可信度及跨视角空间建模精度,当前仅在电脑版可灵AI中开放,且必须选用“视频1.3”模型。该模式不支持网页端或手机App调用,且对输入图片数量、尺寸与主体朝向有硬性限制。
1、打开电脑版可灵AI客户端(非网页端),确保版本号不低于v3.0.2。
2、单击左侧功能栏中的【视频生成】模块。
3、在顶部选项卡中依次点击【图生视频】→【多图参考】,进入专用界面。
4、系统将自动锁定模型为“视频1.3”,不可手动更改为其他版本。
二、准备并上传合规的参考图片组
多图参考依赖图像间语义锚点对齐,需至少2张、最多4张图片,每张均须聚焦同一主体,且覆盖不同角度或姿态,以供AI构建三维运动先验。图片质量直接决定生成结果中肢体比例、面部结构与动作自然度。
1、准备2–4张JPG或PNG格式图片,每张短边像素不低于300px,推荐分辨率统一为1024×1024。
2、确保所有图片中主体为同一人或物,无遮挡、无严重畸变,且光照方向基本一致。
3、各图应体现差异性视角:例如一张正面半身像、一张侧脸45°、一张背面轮廓、一张手部特写(如需强化手势)。
4、将全部图片拖入界面中央虚线上传区,或点击“点击上传”按钮按顺序选取文件;系统将自动编号为图1至图4。
三、配置动作提示词与生成参数
提示词在此模式下起关键引导作用,需明确指定主体将执行的动作类型、节奏特征及空间关系,避免使用抽象形容词。参数设置则影响帧间插值密度与输出稳定性。
1、在提示词输入框中键入不超过60字的中文指令,必须包含动词+部位+方向,例如:“女子抬左手至耳侧,右脚轻点地面,身体微倾,背景光斑旋转。”
2、剔除“优雅地”“大概”“可能”等模糊副词,将“走路”替换为“左脚先行缓步前行”,将“转头”替换为“颈部带动头部向右平转30度”。
3、在右侧参数面板中,将时长设为4秒(多图参考模式暂不支持10秒选项)。
4、画幅比例根据用途选择:9:16适配竖屏传播,16:9适配横屏播放;分辨率固定为1080p,不可下调。
四、启动生成并校验中间帧一致性
多图参考模式在渲染过程中会分阶段输出关键帧校验图,用于验证AI是否准确理解各参考图间的姿态映射关系。用户可在生成中途暂停并调整提示词,但不可更换已上传图片。
1、点击“开始生成”按钮后,界面显示进度条与实时帧预览窗格。
2、当进度达约35%时,系统弹出三张校验图:分别为图1→图2、图2→图3、图3→图4的中间过渡姿态缩略图。
3、若发现某组过渡存在肢体断裂或面部扭曲,立即点击“返回修改提示词”,聚焦修正对应部位动词描述。
4、确认校验图无误后,等待进度条走满,生成完成提示出现。











