必须选用精品克隆+高质视频+精细扣图与声音复刻组合,录制≥60秒、1080p、纯色背景、含自然微表情的正面口播视频,闭口将强制进入极速克隆;上传后训练约4小时,同步用视频音频或单独语音样本完成声音克隆,再通过试播、口型强度调节(0.85~0.95)、动作库设置优化仿真效果。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要用百度一镜数字人生成高仿真主播,必须避开“极速克隆”这类通用模型匹配路径,直接选用精品克隆+高质视频素材+精细扣图与声音复刻组合,否则口型错位、动作僵硬、情绪断层会直接暴露AI痕迹。
准备符合要求的真人视频素材
录制一段时长≥60秒、分辨率≥1080p、光线均匀、背景纯色(推荐浅灰或米白)的正面口播视频。必须张嘴说话——不能闭口、不能只念单字、不能全程微笑不动,要包含自然停顿、抬眉、眨眼、轻微转头等微表情变化。这一步决定后续口型驱动精度,【闭口录制将强制进入极速克隆通道,无法生成高仿真效果】。
手机横屏拍摄即可,无需补光灯;但切忌窗边逆光、头顶射灯、镜面反光,这些会导致AI识别面部轮廓失败。
启动精品克隆流程
登录百度一镜平台 → 进入「形象制作」→ 选择「精品克隆」→ 点击「立即克隆」→ 上传刚录好的视频 → 填写人像名称(建议含真实姓名便于后期管理)→ 选择「自动扣图」(仅当背景为纯色且无杂物时启用)→ 勾选协议 → 点击「开始克隆」。
系统将在后台进行4小时左右的端到端训练,期间不可中断或修改参数。训练完成前,「我的人像」列表中该形象状态显示为「训练中」,不可用于直播或视频生成。
同步完成声音克隆
方法一:在克隆页面勾选「使用视频内音频克隆声音」,系统将提取原声频谱并构建专属TTS模型。此方式音色还原度最高,但【需消耗1次声音克隆权益,且视频音频必须清晰无环境杂音】。
方法二:若视频录音质量差,可跳过此步,待形象训练完成后,在「声音复刻」模块单独上传30秒以上干净语音样本(如朗读《新闻联播》片段),手动触发声音克隆。该样本必须为同一人、同一设备、无变声处理。
验证与微调高仿真表现
第一步:进入「我的人像」→ 找到刚生成的形象 → 点击「试播」→ 输入测试文案(例如:“大家好,今天给大家介绍一款新功能”)→ 观察口型同步率、眨眼频率、肩颈自然摆动幅度。
第二步:若发现口型滞后或嘴角不对称,返回「形象编辑」→ 调整「口型驱动强度」滑块至0.85~0.95区间(过高易失真,过低则不跟嘴)→ 保存后重新试播。
第三步:点击「动作库」→ 添加「点头示意」「手势强调」「侧身转向」三类基础动作 → 设置触发时机为关键词匹配(如“重点来了”触发手势,“谢谢”触发点头),让交互更接近真人节奏。











