必须在提示词中明确写出对白原文和环境音细节,否则ai默认静音或仅配基础bgm;需手动输入含角色名、语气、语速、停顿的对白,并用空间感、节奏、相对音量描述环境音,同时开启口型同步强化并检查波形与方位感。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让秘塔AI生成的视频里人物开口说话、雨声风声自然响起,而不是干巴巴只有画面,就得在提示词里明确写出对白内容和环境音细节,否则它默认静音或只配基础BGM。
在“今天学点啥”里添加对白文本
打开 https://metaso.cn/study → 粘贴文章链接或上传文档 → 进入配置页 → 在「高级设置」中勾选「启用语音讲解」→ 【必须手动输入对白原文,不能只写“人物说话”或“旁白讲解”】。
比如原文是“赵泰站在窗前,心里翻江倒海”,你得改成:“赵泰(低沉缓慢):这扇窗……我守了十年,可外面的人,早就不认我了。”——把角色名、语气、语速、停顿都写进去,AI才可能复现情绪层次。
这一步漏掉,生成的音频就是通用男声平铺直叙,毫无角色感。
用提示词控制环境音效类型与强度
方法一:在「讲解风格」下方的「自定义提示词」框里直接写:
“背景音:持续低频雷声+远处模糊车流声,雨滴敲打铁皮檐角的节奏每3秒一次,音量控制在人声后方15%”
方法二:若想匹配特定场景,用对比式描述更稳:
“不是热闹市集的嘈杂,而是深夜便利店冷柜嗡鸣+自动门开合‘叮咚’两声,间隔8秒”
【环境音不能只写名词,必须带空间感、节奏或相对音量】。写“有鸟叫”大概率出一段突兀的八哥录音;写“晨光微露时,三只麻雀在窗外梧桐枝头断续啁啾,左前侧稍近”才能触发AI的空间建模逻辑。
避免对白与画面错位的实操检查点
第一步:生成前,在配置页确认已开启「口型同步强化」开关(位于音色选择下方灰色小字区域)。
第二步:导出视频后,立刻拖动进度条到人物张嘴瞬间——暂停,看波形是否在开口帧对应位置出现能量峰。如果不是,说明提示词里没给足发音关键词,比如“说‘不’字时嘴角向右牵动”比“他说了一个否定词”管用得多。
第三步:关闭耳机,用手机外放播放一遍。人耳对环境音方位异常极其敏感,如果感觉“所有声音都从正前方砸过来”,就回去重写提示词,加入“左侧空调滴水”“右侧纸张翻页”等方位锚点。











