vidu支持上传参考图片实现高度主体一致性视频生成,包括单图锁定主体、多图协同控制(最多7张)及api批量调用三种方式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望使用Vidu生成具有高度主体一致性的视频,但不确定是否支持上传参考图片作为视觉锚点,则需明确:Vidu不仅支持上传参考图片,而且将该能力作为其核心功能之一深度集成于多个生成路径中。以下是具体实现方式:
一、单图参考生视频(主体参照)
该方法利用一张图像锁定任意主体的视觉特征,使模型在不同场景、动作和镜头下保持该主体形象的高度统一。系统通过U-ViT架构提取图像中主体的结构、纹理、风格等多维表征,并将其作为生成过程中的强约束条件。
1、访问Vidu官网或打开Vidu移动端APP。
2、选择“参考生视频”入口,点击“上传参考图”按钮。
3、从本地设备选取一张清晰、主体居中、光照均匀的图片,格式支持JPG、PNG,分辨率建议不低于1080p。
4、在提示词框中输入具体描述,例如:“穿汉服的少女在樱花树下转身微笑,微风拂动发丝与衣袖”。
5、设置视频参数:时长选5秒,分辨率设为1080p,开启水印(可选)。
6、点击“生成”,系统将在分钟级内输出结果。
二、多图参考生视频(最多7张)
该方法适用于需同时控制人物、场景、道具及美学风格的复杂创作任务。7张参考图分别承担角色形象、服装细节、背景环境、光影氛围、构图范式等不同锚定作用,由导演与分镜智能体协同解析并构建统一视觉协议。
1、进入Vidu平台“一键生成MV”功能模块。
Vidu视频生成插件(viduq3-pro、viduq3-turbo、viduq2、viduq1)。支持文字转视频、图片转视频、参考转视频以及起始编辑。
2、点击“添加参考图”,依次上传至多7张图像,每张图需标注用途(如“主角正面照”“咖啡厅实景图”“古风窗棂特写”)。
3、上传一段背景音乐文件(MP3/WAV格式),并输入文本指令,例如:“林黛玉手持团扇缓步穿过现代艺术展厅,镜头跟随平移,光影随展陈变化流动”。
4、确认智能体分工配置,默认启用导演、分镜、视觉生成、剪辑与合成全流程。
5、提交后系统自动启动异步处理,生成结果将通过站内信通知。
三、API调用方式(开发者适用)
该方法面向需要批量集成或定制化部署的用户,通过标准HTTP请求向Vidu服务端提交图像URL列表与结构化参数,实现程序化调用。请求体中media字段以JSON数组形式承载图像元数据,系统据此加载远程图像资源并执行一致性建模。
1、准备合法有效的DashScope API Key,并确保权限已开通vidu/viduq3-mix_reference2video模型调用权限。
2、构造curl命令,其中-d参数内media数组包含至少1个image对象,每个对象含type和url字段,例如:{"type": "image", "url": "https://example.com/role.jpg"}。
3、设置请求头:content-type为application/json,authorization为bearer后接API Key,x-dashscope-async值为enable。
4、执行命令,获取返回的task_id。
5、使用GET /api/v1/tasks/{task_id}轮询任务状态,待status变为success后,从result.url下载生成视频。










