需通过讯飞开放平台提交审核后,方可在智作调用自定义音色;录音须10~30分钟wav干声,48khz/16bit,-6db~-3db峰值无削波;实名一致、材料齐全,3~7日审核;调用前确认音色状态为“已上线”。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用自己的声音制作AI音色,让讯飞智作完成声音克隆和配音生成,需先通过官方指定流程提交高质量人声样本,再在智作平台完成模型训练与配音调用——讯飞目前不开放个人直接上传音频训练私有音色,必须走「讯飞开放平台→声音复刻服务→审核通过→接入智作」这条路径,跳过任一环节都会失败。
准备符合要求的原始录音素材
录制一段10~30分钟的纯净干声,内容需覆盖普通话常用声韵母组合,避免背景音乐、混响、耳机漏音;建议使用专业电容麦+USB声卡,在安静密闭空间录,采样率48kHz/16bit,保存为WAV格式。
这一步不能用手机自带录音APP随便录——手机自动降噪会抹掉声纹细节,导致后续模型识别不准;也不要用MP3压缩,有损编码会丢失高频泛音特征,讯飞后台校验时直接拒收。
录完后用Audacity检查波形:人声应占满-6dB~-3dB峰值,无削波(顶部平直)、无长时间静音段(>0.5秒)。
在讯飞开放平台提交声音复刻申请
登录讯飞开放平台(https://www.xfyun.cn),进入「产品服务→语音技术→声音复刻」,点击「立即开通」→填写《声音复刻服务申请表》,上传已准备好的WAV文件和身份证正反面照片。
注意:【必须使用本人实名认证的账号提交,且身份证姓名与录音者完全一致】;若用公司账号代申请,需额外提供加盖公章的《声音授权使用承诺书》扫描件,否则审核驳回。
审核周期通常为3~7个工作日,结果以短信+站内信通知。未通过会注明原因(如“环境噪声超标”“语速过快导致音节粘连”),需重新录制后再次提交。
在讯飞智作中调用已生成的AI音色
方法一:网页端直接配音
登录讯飞智作官网(https://zuofei.xunfei.cn)→新建项目→输入文案→在「配音音色」下拉菜单中选择你已成功训练的定制音色(名称后带「自定义」标签)→点击「生成配音」。
方法二:API批量调用
获取声音复刻服务返回的voice_id参数,在智作API文档中调用/tts/v2接口,将voice_id填入request body的voice字段,content传入UTF-8编码的文本字符串,POST请求即可返回base64音频流。
生成时若提示“音色不可用”,说明该音色尚未完成全链路同步——需返回开放平台「声音复刻控制台」,确认状态显示为「已上线」,而非「训练中」或「待发布」。











