百度一镜导出失败大概率因音频或图片格式不兼容,需重转音频为44.1khz单声道mp3、清理图片icc/xmp元数据,并清除浏览器缓存后重试。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

百度一镜数字人视频生成失败,导出环节突然中断,进度条卡在95%不动,或者直接弹出“文件写入异常”提示——这大概率不是模型崩了,而是你上传的音频或图片格式被系统悄悄拒收了。百度一镜虽支持多种格式,但底层解码器对编码参数极其敏感,一个不兼容的MP3头信息、一张带非标准ICC配置的PNG,都可能让整个导出流程在最后一步戛然而止。
检查并重转音频文件
第一步:用播放器右键查看音频属性,确认采样率是否为16kHz、44.1kHz或48kHz;若显示“48000Hz(变比特率)”,这就是隐患源头。
第二步:打开命令行,执行以下转换命令(确保已安装ffmpeg):
ffmpeg -i input.mp3 -ar 44100 -ac 1 -c:a libmp3lame -q:a 2 output.mp3
第三步:替换原文件重新上传。注意【必须删除原文件再上传新文件,不能仅覆盖同名文件】,否则WebUI缓存仍会调用旧文件头信息。
验证图片是否含隐藏元数据冲突
方法一:用Photoshop打开→「文件」→「导出」→「存储为Web所用格式(旧版)」→保存为JPEG,品质设为90,取消勾选“嵌入颜色配置文件”。
方法二:命令行批量清理(Linux/macOS):
convert input.png -strip output.jpg
调用百度PaddleOCR‑VL大模型API,支持PDF、Word、PPT、图片等多格式文档解析,精准识别印刷体、手写体、表格、公式、图表、印章等复杂元素,支持100+语言,可处理不规则布局和跨页长文档。触发词:文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。
方法三:Windows用户可直接用画图打开→另存为JPEG→关闭所有高级选项。这一步看似简单,但【PNG或TIFF中携带的XMP/EXIF/ICC数据常触发HeyGem系解码器报错,而界面不会明示】。
强制刷新导出队列缓存
① 在百度一镜WebUI界面,点击右上角头像→「清除本地缓存」→确认执行;
② 关闭浏览器所有标签页,彻底退出Chrome或Edge进程(任务管理器中杀掉全部chrome.exe);
③ 重新打开浏览器,访问https://yijing.baidu.com,登录后**不要立即上传**,先等待页面底部状态栏显示“服务就绪”再操作;
④ 上传已处理好的音频与图片,点击生成,导出时全程勿切屏、勿锁屏、勿运行其他GPU密集型程序。










