需windows 10/11系统、讯飞智作v4.2.0+、≥16gb内存;安装时勾选高级语音建模与麦克风权限,重启后上传30~60秒高质量单声道录音,完成建模并试听验证后设为默认音色。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用讯飞智作在电脑上克隆自己的声音,生成专属AI配音,整个过程需要先确认硬件是否支持、安装正确版本的客户端、上传合格录音样本、完成音色建模并验证效果。
检查电脑是否满足克隆前提
讯飞智作PC端声音克隆功能依赖本地语音建模能力,必须使用Windows 10/11系统且已安装讯飞智作v4.2.0及以上版本;【不支持Mac或Linux系统】。显卡不是硬性要求,但若使用NVIDIA显卡(RTX 3050及以上),建模速度可提升40%以上。内存需≥16GB,否则上传音频后可能触发“模型加载失败”错误提示。
打开任务管理器→性能页签→查看“内存”使用率,若空闲低于2GB,建议关闭浏览器等后台程序再操作。
下载并安装讯飞智作Windows客户端
直接访问讯飞智作官网(https://zuofei.xunfei.cn)→点击右上角【下载客户端】→选择“Windows版”→下载.exe安装包。
运行安装程序时,务必勾选“启用高级语音建模功能”和“允许访问麦克风及录音文件”,否则后续无法进入声音克隆流程。安装完成后不要立即启动,先重启电脑——这一步能避免Windows音频服务未就绪导致的“设备不可用”报错。
准备并上传高质量录音样本
讯飞智作要求样本为一段连续、无剪辑、无背景音的人声朗读,时长严格控制在30~60秒之间,格式为WAV或MP3,采样率16kHz,单声道。推荐使用手机自带录音机录制,环境选安静卧室,距离话筒20cm,语速平稳,读以下三句话(每句间隔2秒):
“今天天气很好,阳光明媚。”
“我正在学习人工智能语音技术。”
“这段声音将用于我的视频配音项目。”
录完后用文件管理器重命名文件为“myvoice_sample.wav”,双击确认可正常播放。若听到电流声、回声或吞字,必须重录——【样本质量不合格会导致克隆音色失真或建模中断】。
在客户端中完成声音克隆全流程
第一步:启动讯飞智作→登录同一讯飞账号→左上角菜单栏点击【工具箱】→选择【声音克隆】。
第二步:点击【上传录音】→选中刚准备好的myvoice_sample.wav→等待进度条走完(约8~15秒)→系统自动跳转至建模页。
第三步:页面显示“正在分析声纹特征”,此时不可关闭窗口或切换应用,否则建模会失败;约40秒后出现“克隆成功”弹窗,并生成一个带你姓名缩写的音色名称(如“Zhang_S_2026”)。
第四步:点击该音色右侧的【试听】按钮→输入测试文案“你好,这是我的AI声音”,点击生成→播放确认音色自然度与原声相似度。若发现明显机械感或断句异常,返回重传样本,不要尝试调节参数补救。
第五步:确认无误后,点击【设为默认配音音色】→后续所有文本转语音任务将自动调用该克隆音色。











