必须使用runway gen-4.5模型,上传mp3/wav音频(≤15秒)启用audio sync,使画面动作、镜头切换严格对齐音频节奏与能量峰值,导出纯画面视频以供后期精准配音。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要让AI生成的视频严格贴合已有音频的节奏、情绪和关键节点,比如口播视频、广告配音或音乐MV,而不是让音频去适配AI随意生成的视频动作。
确认音频是否支持作为参考输入
打开 Runway 网页端(app.runwayml.com),登录后进入工作区 → 点击左上角「+ New Project」→ 选择「Gen-4.5」模型(仅 Gen-4.5 支持原生音频驱动,Gen-3 alpha 及更早版本不支持音频参考输入)。
【必须使用 Gen-4.5 模型,其他版本点击「Upload Audio」按钮后会灰显或直接报错】
上传音频并绑定到视频生成流程
方法一:在文本生成视频(Text to Video)流程中嵌入音频参考
1、在 Gen-4.5 的「TEXT」标签页输入提示词后,向下滚动至「Advanced Options」区域 → 点击「Upload Audio Reference」按钮;
2、上传 MP3 或 WAV 格式音频文件(时长建议 ≤ 15 秒;超过 30 秒可能触发截断或生成失败);
3、上传成功后,界面自动显示波形图与「Audio Sync Enabled」状态灯,此时提示词中的动作描述(如“主持人点头”“镜头随鼓点推进”)会被模型优先对齐音频能量峰值;
4、点击「Generate」——这一步不会把音频混入输出视频,而是用它约束运动节奏和镜头切换时机。
方法二:用已有视频匹配新音频(Video + Audio Ref)
先上传一段基础视频(如绿幕人像、静态产品图或简单运镜片段),再上传目标音频 → 在「Refine」模式下选择「Audio Sync」选项 → 模型将重生成画面运动,使人物口型、肢体节奏、转场卡点与音频波形严格对齐。
注意:原始视频不能含强噪声或严重模糊,否则音频同步精度会下降 40% 以上。
导出时保留音频参考生成结果
视频生成完成后进入预览页 → 点击右下角「Export Settings」→ 确保「Include Audio Track」未勾选(该选项仅用于混入原始参考音频,会覆盖你后期配好的正式音轨);
直接点击「Export Video」即可获得纯画面文件,其帧级运动已按你上传的音频参考完成时间对齐;
你可将此视频导入剪映、Premiere 等软件,再叠加最终版配音/配乐,实现零延迟口型匹配与节拍卡点。











