根本原因是参考音频含人耳不易察觉但ai会复刻的噪声;需确认杂音来源、优化录音环境(关窗/空调/拉帘)、关闭手机agc、10–15厘米距离录音,并用audacity三步降噪导出16khz/16bit wav。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

度加AI声音克隆生成语音带“嘶嘶声”“底噪”“嗡鸣”或“断续失真”,根本原因不是模型故障,而是原始参考音频中混入了人耳不易察觉但AI会忠实复刻的噪声成分——它不挑食,你喂进去什么,它就学什么。
先确认杂音来自哪里
打开你的参考音频,在手机上用自带播放器播放,音量调至60%,闭眼听3秒:如果能分辨出空调声、键盘敲击、电流底噪、回声或呼吸声过重,【问题100%出在参考音频本身】。此时模型没坏,只是太老实。
若音频在Audacity里波形图显示整段均匀浮动(非人声区域也有起伏),属于环境底噪;若仅开头/结尾有毛刺、中间平滑,大概率是录音设备AGC自动增益抬高了静音段底噪;若同一段音频反复生成结果差异极大,才需排查服务端显存或缓存问题。
录音环境必须做到这三点
关窗+关空调+拉厚窗帘——这是最低成本有效的降噪组合。卧室衣橱内录制效果常优于客厅,因密闭空间天然吸音,且能隔绝楼道脚步、电梯运行等低频干扰。
手机录音时务必关闭“降噪增强”“语音优化”类系统功能,iOS在设置→声音与触感→电话噪声消除中关闭,安卓则在录音App权限里禁用“自动增益控制(AGC)”。【开启AGC后,安静时AI会把抬高的底噪当人声学】。
离麦克风10–15厘米说话,比20厘米更稳。太远导致AI抓不住基频细节,太近易喷麦引发失真,这个距离刚好让胸腔共鸣充分释放又不压破音。
三步本地快速降噪(Audacity实操)
第一步:导入音频→用鼠标拖选一段纯噪音(无人声)的0.8–1.5秒片段→点击菜单栏“效果”→“Noise Reduction & Repair”→“Get Noise Profile”。
第二步:Ctrl+A全选→再次进入同一菜单→将“Noise Reduction (dB)”设为14,“Sensitivity”调至-16,“Frequency Smoothing”保持默认6→点击OK。
第三步:导出为WAV格式(右键轨道→“Export Audio…”→格式选WAV(Microsoft)→编码选“Signed 16-bit PCM”)。【切勿导出MP3,CosyVoice2-0.5B和度加均要求16kHz/16bit无损WAV】。
备选方案:不用软件也能压噪
方法一:用剪映APP“智能降噪”功能。导入音频→点击“音频”→“降噪”→选择“会议降噪”模式→导出。适合应急,但对持续底噪抑制弱于Audacity。
方法二:重录时用手机原装耳机麦克风(非外放录音)。实测比手机本体麦克风信噪比高3倍以上,且线控麦克风位置固定,避免手持晃动引入抖动噪声。
方法三:说一句“啊——”持续3秒,录完立刻删掉开头1秒和结尾1秒,只留中间1秒平稳段作为参考音频。CosyVoice3实测该法对儿童/高音域人声克隆稳定性提升明显。











