用百度一镜数字人复刻真实声音只需30秒高质量录音,上传后90秒完成克隆,支持电商场景语气保留,并可快速替换直播间语音。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用百度一镜数字人快速复刻自己或主播的真实声音,无需专业录音设备、不用反复录几十分钟,只要一段干净语音就能生成高度拟真的定制音色。
准备30秒高质量录音
打开手机备忘录或录音App,用原生麦克风在安静房间朗读一段电商带货类文本(如“这款防晒霜质地清爽不油腻,夏天用刚刚好”),全程保持中等语速、自然停顿,时长严格控制在【28–32秒】之间。低于25秒模型无法提取有效声纹特征,超过40秒系统会自动截断前段,导致关键音色丢失。
这一步操作起来很简单,直接把文件拖进去就行。
上传并启动克隆流程
登录百度慧播星后台→进入「声音克隆」模块→点击「新建克隆音色」→选择「真人一键克隆」→上传刚录好的音频文件→勾选「保留语气风格」→点击「开始训练」。
系统将基于电商专属音库大模型进行轻量微调,全程无需手动标注或对齐文本,30秒音频输入后约90秒即可完成音色生成。
验证与替换直播间语音
方法一:在「音色管理」页找到刚生成的音色,点击右侧「试听」按钮,播放预设话术(如“欢迎来到直播间”)确认口型同步度和语气自然度。
方法二:进入已配置好的数字人直播间编辑页→在「语音设置」中下拉选择该音色→保存并发布→推流开播即生效。
【注意:首次替换后需等待1分钟全链路缓存刷新,否则可能仍播放默认音色】











