录制声音克隆素材须消除环境回音,需物理降混响、关闭干扰设备、使用指向性麦克风并控制距离,再经软件监听与平台质检达标(回声<-35dbfs、rt60<0.2s)方可正式录制。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

录制声音克隆素材时,环境回音会直接污染声学特征建模,导致数字人语音输出带有明显空旷感、拖尾或“在浴室说话”效应,必须在采集源头就消除。
关闭房间混响源
拉上厚窗帘、铺地毯、挂毛毯——这些不是装饰动作,是物理降混响的刚性要求。硬质墙面+玻璃窗+空旷空间构成强反射组合,哪怕只录10秒,模型也会把回声当作语音本体学习。
关掉空调、风扇、电脑机箱风扇。设备低频嗡鸣会与人声耦合生成调制类回声,在频谱上难以剥离。
【务必关闭所有带麦克风的智能设备】——包括手机、智能音箱、会议平板。它们的AEC(回声消除)模块可能反向注入残留回声信号,这种干扰肉耳难辨,但AI训练时会被放大识别为语音成分。
使用指向性麦克风并控制拾音距离
选用心形指向麦克风,正面朝向嘴部,左右两侧和后方自然衰减40dB以上,大幅削弱反射路径拾音。
嘴部离麦保持15–20cm。太近引发喷麦和近讲效应(低频异常增强),太远则信噪比下降,系统自动提升增益反而放大墙面反射声。
麦克风支架加装海绵防震架,避免桌面传导振动被误录为低频回声底噪。
软件层实时监听与验证
第一步:打开Audacity或Adobe Audition,新建轨道→点击“录音”按钮进入监听模式→正常朗读一句“今天天气不错”。
第二步:暂停录音→放大波形图,观察语句结束后是否出现持续衰减的拖尾振荡(典型回声特征)。若有,说明物理环境未达标,必须返回第一步调整布置。
第三步:导出该段音频为WAV格式→上传至百度一镜平台“音频质检”工具(路径:数字人控制台→声音克隆→素材上传页→右上角「检测」按钮)→等待3秒返回报告。仅当显示“回声能量<-35dBFS”且“混响时间RT60<0.2s”时,才可进入正式录制。











