第一步是录制10秒高质量普通话音频:需关闭手机降噪、在密闭空间录音、用系统提示句或满足三条件的自定义句,按横置手机45°角、15厘米距离、自然呼吸等规范操作。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用度加AI快速克隆自己的声音,第一步不是点按钮,而是录出一段真正能被AI“听懂”的10秒音频——它不挑设备,但极度挑剔清晰度、稳定性和发音完整性。
录音前必须做好的三件事
关掉手机自动降噪功能。很多安卓机型默认开启AI降噪,会把你的气声、轻声甚至尾音削掉,导致克隆后声音发干、断句生硬。
找一个密闭空间,比如关上门的卫生间或衣柜里。环境噪音超过40dB(相当于冰箱低鸣)时,AI会把背景嗡鸣误判为你的声带振动特征,生成模型后容易带“电流底噪”。
【必须用普通话朗读,哪怕你平时说方言】度加AI当前中文模型训练语料98%为普通话,若用粤语/四川话录样本,系统虽能完成建模,但后续文字转语音会强制映射到普通话语音库,导致声调错位、字音失真。
10秒采样内容怎么选
方法一:直接念系统提示句(最稳妥)
打开度加AI→进入“声音克隆”页→点击“开始录制”,屏幕会自动弹出指定句子,例如:“今天阳光很好,我想去公园散步。”这句话已过声学校准,覆盖 a/o/e/i/u 元音、b/p/m/f 辅音、升调/降调/轻声,且无生僻字和连读陷阱。
方法二:自定义句子(需满足三个硬条件)
① 长度控制在9–11秒;② 必须包含至少两个四声调字(如“世界”“快乐”“美丽”);③ 不能出现“嗯”“啊”等语气词或突然停顿。常见翻车句:“这个……我觉得吧……”——AI会把省略号处的空白当成呼吸节奏固化进模型,生成语音时频繁卡顿。
方法三:照着节拍器录(适合语速不稳者)
用手机秒表计时,从“1”开始匀速朗读,每字间隔0.5秒。例如:“我→喜→欢→吃→苹→果→很→甜→多→汁”,共10字,刚好10秒。这能强制压平语速抖动,避免AI把偶然的拖腔识别成个人习惯。
录音操作关键步骤
第一步:手机横置,麦克风朝向嘴唇斜下方45°,距离15厘米。离太近喷麦爆音,太远拾音衰减,这个角度能兼顾齿音清晰度与胸腔共鸣捕捉。
第二步:朗读时保持自然呼吸,不要刻意提气或压喉。曾有用户模仿新闻主播“字正腔圆”,结果AI把人为收紧的咽部肌肉振动当成了声纹特征,生成语音后听起来像在憋气说话。
第三步:录完立刻试听——戴上耳机播放原始音频,重点听第3秒和第7秒附近是否有“嘶”“噗”等杂音。若有,必须重录。度加AI不支持后期降噪,原始音频里的瑕疵会1:1刻进声线模型。
第四步:确认无杂音后,点击“提交样本”,等待12–18秒。进度条走完即生成可用音色,无需手动命名或调整参数。











