需准备清晰正面半身照(jpg/png,无遮挡、均匀光照)和15秒内干净音频(wav/mp3),上传至liblibai数字人页,选duix-base v2.3模型,设9:16或16:9比例、“自然”动作、“保留原始肤色”,启用高精度唇动匹配仅当嘴型滞后,下载前校验关键帧,支持指令修复穿帮。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

准备数字人基础素材
你需要一张清晰、正面、半身以上的人物照片,背景干净,人脸无遮挡,光照均匀——这是Duix-Avatar类驱动方案能稳定输出嘴型和微表情的前提。LiblibAI当前视频生成页默认调用的数字人能力底层即兼容该协议,所以照片质量直接决定最终说话视频是否自然。
另备一段时长15秒以内的WAV或MP3音频文件,内容为人物台词,语速适中,避免爆破音密集或突然静音。若使用AI配音,请先在LiblibAI「AI配音」板块生成并下载,确保音频无杂音、无截断。
【照片必须为JPG/PNG格式,不能是截图或带水印的压缩图】
在LiblibAI中启动数字人生成
打开LiblibAI官网(liblib.ai),登录账号后点击顶部导航栏「视频生成」→ 选择「数字人」标签页 → 点击「上传照片+音频」按钮。
先拖入你准备好的人物照片,系统自动识别面部区域并显示预览框;再点击「添加音频」,上传已准备好的台词音频文件。此时页面右侧会实时显示语音波形图,确认波形完整、无明显空白段。
模型默认选用「Duix-Base v2.3」,该版本对亚洲人脸兼容性最优,无需手动切换。若需调整口型同步精度,可开启「高精度唇动匹配」开关——但会延长生成时间约40秒,仅当首版输出嘴型明显滞后时启用。
配置与生成关键参数
第一步:选择输出比例。竖屏短剧选9:16,横屏广告或B站投稿选16:9,不支持自定义分辨率。
第二步:设置动作幅度。滑块共三档:「静态」(仅嘴部运动)→「自然」(含轻微点头与眼神流转)→「生动」(加入肩部微动与手势模拟)。新手务必从「自然」起步,选「生动」易导致头部姿态失真,尤其侧脸角度超过30°时画面崩解风险陡增。
第三步:勾选「保留原始肤色与发色」。该选项强制锁定参考照的色值特征,关闭后AI可能根据音频情绪自动偏暖/偏冷,造成人物形象漂移。
确认无误后点击「立即生成」,等待进度条走完(通常90–150秒),生成成功后自动跳转至预览页。
导出与本地校验
预览页可全屏播放,用空格键暂停逐帧检查嘴型、眨眼节奏、头部稳定性。重点看第3秒、第8秒、结尾前2秒三个节点——这些位置最容易出现音频-画面脱节。
满意后点击右上角「下载MP4」,文件默认为H.264编码、30fps、1080p,无需二次压缩可直接用于抖音、视频号发布。
如发现局部穿帮(例如耳环闪烁、发际线跳变),不要重跑全流程,直接返回上一页,在「高级选项」中输入「fix ear ring flicker + stabilize hairline」后重新生成——LiblibAI支持带修复指令的轻量重绘,30秒内完成补救。











