克隆声音需待状态栏显示“ready to use”且旁白旁出现播放与铅笔图标才生效;语速调至0.85x~0.95x,金融/医疗类建议0.88x;情绪通过标签或emotion boost设置,但二者不可叠加;局部发音错误需将词拆为“a-p-i”格式并补录矫正。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

确认克隆声音已加载并处于可调状态
上传5分钟以内干净录音完成语音克隆后,必须等待右上角状态栏从“Cloning…”变为“Ready to use”,且脚本编辑页左侧每段旁白右侧出现播放图标和铅笔图标,才代表克隆声纹已绑定成功并可实时调节;若仍显示“Processing…”或无播放按钮,所有后续操作均无效。
调整克隆声音的语速与停顿节奏
点击右上角齿轮图标 → 进入「Voice Settings」→ 确认当前音色名称右侧标注有「Cloned」标签 → 拖动「Speech Rate」滑块至0.85x~0.95x区间。
低于0.85x会导致克隆声出现不自然拖音,高于0.95x则高频辅音(如“s”“sh”“z”)易被压缩失真;金融/医疗类术语密集段落建议固定设为0.88x,这是当前克隆模型保留口型同步精度的临界值。
系统自动在段落间插入0.6秒基础停顿,若原文含“【注意】”“⚠️”等标记,会额外延长至1.4秒——该行为不可关闭,但可在文字中手动添加“……”来微调呼吸感。
切换克隆声音的情绪风格
方法一:点击某段右侧铅笔图标 → 在编辑框末尾添加情绪标签,例如“请检查参数【严肃】”或“这个技巧很实用【轻松】”。支持标签:【严肃】【轻松】【耐心】【果断】【疑问】。AI会据此调整语调弧度与重音位置,无需重启生成。
方法二:在Voice Settings面板中启用「Emotion Boost」开关 → 选择预设情绪强度:Low / Medium / High。Medium档位适配90%培训类内容;High档位仅建议用于产品发布视频开场30秒,否则连续使用超45秒会触发语音疲劳感,表现为尾音发虚、气声比例异常升高。
【切勿在开启Emotion Boost的同时手动添加多个情绪标签】,二者叠加会导致声纹抖动,已合成音频无法回滚修复。
替换克隆声音中的局部发音
第一步:定位到发音不准的句子,例如AI将“API密钥”读成“阿皮密钥”。
第二步:点击该段右侧铅笔图标 → 将“API密钥”改为“A-P-I密钥” → 按回车确认。
第三步:立即点击同一行右侧播放图标试听,若仍未修正,说明克隆模型未学习该缩写读法 → 返回原始录音样本,补录3遍“A-P-I密钥”清晰发音(间隔1秒),重新上传克隆。
这一步操作起来很简单,但必须逐字拆解字母,写成“A-P-I”而非“API”或“Api”,否则模型仍按默认词典发音。











