必须走文心一言图像生成与文心一格视频生成双通路组合流程,第一步构造含人物属性、服装细节、妆容发型、场景光照、镜头运镜六要素的中文prompt并上传纯色背景参考图;第二步调用text2image或image2image接口生成1024×1536静态关键帧;第三步在文心一格控制台以图片驱动模式选择预设动作生成3秒720p短视频;第四步用ffmpeg等工具本地合成、配乐、硬嵌字幕,导出h.264 high profile level 4.0格式视频。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要用文心AI生成穿搭美妆类视频并套用虚拟模特,必须走百度智能云“文心一言·图像生成”+“文心一格·视频生成”双通路组合流程,不能只调用单一API接口,否则无法输出带人体姿态与服装贴合的动态视频。
第一步:准备合规的Prompt与素材
在文心一格控制台或API调用前,必须先构造含明确结构的中文Prompt,格式为:“【人物属性】+【服装细节】+【妆容发型】+【场景光照】+【镜头运镜】”。例如:“亚洲女性,25岁,身穿米白色垂感阔腿西装套装,内搭浅杏色真丝吊带,裸妆+低马尾+珍珠耳钉,柔光棚拍,中景平视缓慢横移”。
⚠️注意:不能出现“真人照片”“真实人脸”“肖像权”等敏感词,否则触发内容审核拦截;若需指定性别/年龄/肤色,必须用“亚洲女性”“青年”“暖调肤色”等平台白名单表述。
上传的参考图仅支持JPG/PNG,且必须是纯色背景(#FFFFFF或#000000),不得含文字、logo、水印。若上传带褶皱的服装平铺图,系统将自动识别布料纹理用于3D建模。
第二步:调用文心一格图像生成接口生成关键帧
方法一:使用/v1/ernie-vilg/text2image接口生成首帧静态图
发送POST请求至https://aip.baidubce.com/rpc/2.0/ai_custom/v1/wenxinworkshop/image/text2image,Header中携带Authorization: Bearer {access_token},Body中传入JSON:
{"text":"亚洲女性,25岁,身穿米白色垂感阔腿西装套装……","size":"1024*1536","n":1,"style":"realistic"}
方法二:若已有服装设计稿,改用/v1/ernie-vilg/image2image接口进行风格迁移
需额外传入base64编码的原始图,并设置"strength": 0.65——数值低于0.5会导致服装结构坍塌,高于0.8则丢失原图细节。
【关键前提】必须先通过OAuth2.0获取access_token,调用https://aip.baidubce.com/oauth/2.0/token,参数为grant_type=client_credentials&client_id={API Key}&client_secret={Secret Key}。token有效期2小时,过期后需重新获取。
第三步:将静态图转为3秒短视频
第一步:进入文心一格Web控制台 → 点击“视频生成” → 选择“图片驱动”模式
第二步:上传上一步生成的1024×1536静态图 → 在动作库中选择“站立微转身”或“侧身展示衣摆”等预设动作(不可自定义骨骼动画)
第三步:勾选“服饰贴合增强”和“妆容动态保真”,点击生成
这一步操作起来很简单,直接把文件拖进去就行。但要注意:生成时长固定为3秒,不支持延长;若需多角度展示,必须重复此流程并分别上传不同视角的关键帧图。
生成完成后下载MP4,分辨率锁定为720p,帧率为24fps,无音频轨道。
第四步:本地合成与导出最终视频
1. 用FFmpeg合并多个3秒片段:ffmpeg -f concat -safe 0 -i filelist.txt -c copy output.mp4
2. 添加背景音乐:使用Python的moviepy库加载MP4→插入音轨→导出,注意音画同步偏移不得超过±0.15秒,否则抖音等平台会判定为“音画不同步”限流
3. 添加字幕:用whisper.cpp本地跑ASR生成.srt,再用ffmpeg硬嵌字幕,命令为ffmpeg -i input.mp4 -vf "subtitles=subtitle.srt" -c:a copy output_final.mp4
导出时编码必须选H.264,Profile设为High,Level设为4.0,否则小红书APP会拒绝上传。










