runway的act-two可将手机自拍视频驱动虚拟角色实现电影级口型同步与微表情动画,仅需上传半身表演视频和角色图,在网页端完成全部操作。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用一段手机自拍视频驱动虚拟角色说话、做表情、摆动作,又不想买动捕设备、不折腾绿幕布光,Runway 的 Act-Two 就是为你准备的——它只要求你上传一段清晰的半身表演视频和一张角色图,就能生成电影级口型同步与微表情动画,整个流程在网页端完成,无需安装插件或本地算力。
准备驱动视频和角色素材
打开 app.runwayml.com,登录后点击左下角 【Act-Two】 图标,进入专用工作区。
驱动视频必须是手机横向拍摄的半身近景(肩部以上),面部占画面 50% 以上,环境光线均匀、无强阴影或反光;如果人脸被遮挡超过 1 秒,后续口型会严重错位。
角色输入支持图片或视频:图片需为正面清晰人像(建议白底/纯色背景),避免戴眼镜、帽子或夸张妆容;若用视频,则第一帧必须是完整正脸静帧,否则系统无法锚定角色基准形态。
拖拽驱动视频到画布左侧区域,再拖拽角色图到右侧区域——两个文件必须同时加载成功,右上角才会亮起绿色“Ready”提示。
设置镜头与运动参数
方法一:自动镜头推荐
点击“Auto Camera”,系统会基于驱动视频中人物头部运动幅度,智能匹配推拉、平移或轻微俯仰组合,适合 90% 的日常口播类内容。
方法二:手动镜头控制
启用“Manual Camera”,滑块调节三项核心参数:【Zoom】 控制景别(0.8–1.5 倍焦距),【Pan/Tilt】 控制水平/垂直摇镜范围(±15° 内最稳定),【Roll】 倾斜值务必保持为 0,否则角色会歪斜失真。
注意:镜头参数调完后必须点击“Apply”,否则生成时仍按默认值运行。
优化口型与表情精度
第一步:确认音频已自动提取
上传驱动视频后,Runway 会在 3 秒内完成语音分离,波形图显示在时间轴底部;若未出现波形,请检查视频是否含原始人声(静音视频无法触发口型驱动)。
第二步:启用唇形强化
勾选 “Lip Sync Refinement”,该选项强制模型在每帧中优先对齐音素-嘴型映射关系,尤其对中文闭口音(如“b、p、m”)和卷舌音(如“zh、ch、sh”)提升明显。
第三步:微调表情权重
拖动 “Expression Intensity” 滑块至 60–75 区间:低于 50 表情僵硬如面具,高于 80 则易出现眼球震颤或嘴角撕裂——这个数值没有标准答案,需结合角色皮肤质感反复试跑。
启动生成并导出结果
点击右上角 “Generate” 按钮,系统开始渲染;4 秒视频约耗时 90–120 秒,期间不可关闭页面或刷新。
生成完成后,预览窗口自动播放,点击下载图标 → 选择 “MP4 (H.264)” 格式 → 保存到本地。











