百度一镜支持音频驱动数字人,需开通“音频驱动”权限、实名认证及企业审核;音频须为16khz/单声道/16bit;调用api时需携带含scope=video_retalking的access_token,返回video_url需带referer头下载。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你有一段录好的口播音频,想直接驱动百度一镜数字人做出精准口型,不经过TTS重生成、不手动调音素、不依赖网页拖拽——目标是把.wav或.mp3丢进去,API返回带对齐口型的视频帧序列或可合成视频流。
确认接口可用性与权限开通
登录百度一镜控制台 → 进入「数字人服务」→ 点击左侧菜单「API管理」→ 找到「音频驱动数字人」服务项。该接口默认关闭,【必须勾选「启用音频驱动」并完成实名认证+企业资质审核】,否则调用会返回403错误且无明确提示。
开通后,在「密钥管理」页复制Access Key ID和Secret Access Key,这两个值将用于后续签名计算,不可明文硬编码在前端代码中。
准备符合要求的音频文件
上传前必须确保音频满足三项硬性条件:采样率严格为16kHz(不是44.1k/48k)、单声道(Stereo会导致口型漂移)、位深度16bit。ffmpeg一键转码命令如下:
ffmpeg -i input.mp3 -ar 16000 -ac 1 -bits_per_sample 16 -y output.wav
注意:若原始音频含大量静音段(如停顿超1.2秒),建议先用Audacity或sox做语音端点检测(VAD)裁切,否则百度一镜会把长静音误判为“持续闭嘴”,导致后半段口型滞后。
构造HTTP请求体
方法一:使用官方SDK(推荐)
安装Python SDK:pip install baidu-aip
调用百度文档解析API,支持18+格式,提取文本、表格、版面分析、OCR识别及RAG文档分块。适用于文档解析、文本/表格提取、结构分析、扫描件处理。触发词:文档解析、PDF解析、Word解析、表格提取、OCR、文档分析、提取文本、文档结构、扫描识别。
初始化Client时传入access_token(非AK/SK),需先调用/oauth/token接口换取,有效期2小时;【token必须带scope=video_retalking】,漏掉此参数将返回“权限不足”而非具体错误码。
方法二:手写POST请求
请求地址:https://aip.baidubce.com/rpc/2.0/speech/tts/v1/audio2video
Header必填:Content-Type: multipart/form-data;Authorization: Bearer
Body字段:image(base64编码的数字人形象ID,非图片文件)、audio(二进制音频文件)、config(JSON字符串,必须含{"mouth_sync": true, "output_format": "mp4"})
解析返回结果并获取视频
成功响应返回JSON,含task_id和status字段。status为“success”时,data.video_url为直链地址,有效期24小时;若为“processing”,需轮询GET /rpc/2.0/speech/tts/v1/task?task_id=xxx,间隔不得短于3秒,否则触发限频熔断。
下载视频时务必带上Referer: https://aip.baidubce.com,否则返回403 Forbidden——这是百度一镜CDN的防盗链策略,文档未明示但实测必需。










