讯飞智作克隆声音必须使用未压缩pcm编码的wav格式音频,采样率44.1khz、位深16bit,时长5–8秒(标准模式)或3分钟以上(高保真模式),严禁拼接或后缀伪装。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

讯飞智作克隆自己声音时,必须提供符合其声纹提取机制要求的原始音频,否则模型无法稳定提取基频轮廓、频谱包络等关键声学嵌入特征,导致生成语音失真或辨识度极低。
讯飞智作官方支持的音频格式
讯飞智作当前(2026年8月)明确支持上传的音频格式包括:WAV、MP3、M4A、AAC、AMR、PCM。其中【WAV格式为首选,且必须为未压缩的PCM编码】。
其他格式虽可上传,但系统会在后台自动转码——MP3/AAC等有损压缩格式可能丢失高频共振峰细节,AMR在低比特率下会抹除气息声与轻辅音,直接影响音色还原度。
为什么WAV是唯一推荐格式
第一步:使用录音设备或手机专业录音App,以44.1kHz采样率 + 16bit位深录制纯人声片段;
第二步:确保录音全程无背景音乐、空调噪音、键盘敲击声,禁用任何实时降噪功能;
第三步:将文件保存为WAV格式,不经过Audacity等工具二次导出——直接从录音App“另存为WAV”或“导出为WAV”,避免被自动转成MP3再重命名后缀。
这一步很关键:很多用户把MP3文件手动改成.WAV后缀就上传,讯飞智作后台检测到实际为MP3编码,会直接拒绝识别或触发错误提示。

音频时长与内容规范
方法一:标准克隆模式(推荐)→ 录制一段5–8秒的清晰独白,内容需包含“啊、哦、嗯、你、我、他、谢谢、你好、再见”等覆盖元音与辅音组合的自然语句;
方法二:高保真克隆模式 → 需提供3分钟以上WAV音频,但必须是同一环境、同一设备、同一麦克风录制,中间不能有停顿或剪辑痕迹;
【严禁拼接多个音频片段生成“伪长音频”】——讯飞智作的声纹编码器对相位连续性敏感,拼接点会产生嵌入向量断裂,导致合成语音在句中突变音色。











