updream可自动生成环境音与动作音效,但不支持文本生成人声;ai配音需通过音频节点tts或绑定配音轨道实现,手动对齐需用声画同步面板帧级校准。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

updream能生成带声音的视频,不需要额外导入音频文件或切换到其他工具,系统会在视频生成阶段自动匹配环境音、动作音效和基础语音节奏,但不支持直接输入配音文本生成人声。
自动生成环境音与动作音效
在视频节点完成生成后,右侧参数栏会默认勾选「添加环境音轨」。该功能由updream内置的AudioWeave 1.2模型驱动,可识别画面中物体材质(如雨衣反光、瓷砖脚步声)、空间结构(地铁站混响、教室空旷感)和动作类型(推门、转身、奔跑),实时合成匹配音效。
点击「生成音效」按钮,系统将自动为当前视频节点渲染一条独立音轨,时长与视频完全同步,导出MP4时自动混音封装。
注意:若画面中出现明显口型动作(如张嘴说话),模型不会生成对应语音,仅补足呼吸声、衣物摩擦等辅助音——【要输出人声必须走配音流程,不能依赖此功能】。
用AI配音生成旁白或角色台词
方法一:新建「音频节点」→ 在输入类型中选择「文本转语音」→ 输入中文台词(例如:“她没等到车,只等到一场更大的雨。”)→ 选择TTS模型为「Bilibili-Voice S3」(唯一支持情绪停顿与方言语调的模型)→ 点击生成。
方法二:在已有视频节点上右键 → 「绑定配音轨道」→ 弹出对话框中粘贴台词 → 系统自动切分语句、匹配镜头时长、插入淡入淡出,生成时间轴对齐的WAV文件。
这一步操作起来很简单,直接把文案粘进去就行,但要注意每段台词不能超过48字,超长会被截断且不提示。
手动导入外部配音并精准对齐
第一步:准备已录制好的WAV或MP3配音文件,采样率必须为48kHz,单声道优先;
第二步:拖拽音频文件至画布 → 右键该音频节点 → 「设为配音主轨」;
第三步:选中目标视频节点 → 按住Shift键同时点击该音频节点 → 画布自动弹出「声画同步面板」;
第四步:播放预览,听到人声起始点时按空格暂停 → 拖动视频节点时间滑块,使第一帧画面与配音首字口型重合 → 点击「锁定同步」,后续所有剪辑操作将保持帧级对齐。
若配音文件含背景音乐,系统会自动分离人声轨道;但分离失败时不会报错,而是静音处理整条音轨——【务必在导入前用Audacity先行降噪并剔除BGM】。











