百度一镜数字人全身像需拍摄阶段即按目标构图执行,不可后期转换;必须使用绿幕双轨或单次多构图拍摄,确保光源、背景、服装一致;上传时关闭自动裁剪并勾选“保留完整肢体结构识别”,设置9:16或16:9比例。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

用百度一镜数字人完成半身像到全身像转换,不是靠后期裁剪或缩放实现的,而是必须在拍摄阶段就决定构图比例——因为数字分身训练依赖原始视频素材,【训练结果为1:1复刻】,拍什么样子,生成的数字人就固定成什么样子。
拍摄前确认构图需求
打开「人像拍摄指导」文档,重点阅读“数字分身拍摄须知”部分,明确本次拍摄目标是用于短视频口播还是直播场景;若需频繁切换半身/全身镜头,必须提前规划多套拍摄方案,不能寄希望于AI自动拉远镜头。
对照使用场景反推拍摄方式:知识类口播通常用半身构图突出表情与手势,电商带货直播则常需全身展示服装或动作,此时应直接按全身像标准拍摄,而非先拍半身再“转”全身。
实拍阶段执行全身像构图
方法一:绿幕实景双轨拍摄
① 搭建绿幕环境,确保人物头顶距顶部留白≥30cm,脚底距底部留白≥40cm,保证全身轮廓完整不切脚;
② 摄像机位置固定,使用三脚架+水平仪校准,避免俯仰角度导致腿部变形;
调用百度PaddleOCR‑VL大模型API,支持PDF、Word、PPT、图片等多格式文档解析,精准识别印刷体、手写体、表格、公式、图表、印章等复杂元素,支持100+语言,可处理不规则布局和跨页长文档。触发词:文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。
③ 拍摄时模特双脚自然分开与肩同宽,双手放松垂落或做基础手势,保持3秒静止后开始说话,全程无剧烈位移——这一步直接影响后续数字人站立稳定性,抖动或频繁走动会导致全身姿态合成失真。
方法二:单次拍摄多构图版本
在同一场拍摄中,分别录制半身(腰部以上)、三分身(大腿中部以上)、全身(含脚)三段独立视频,每段开头统一做3秒闭嘴静止,结尾也保持3秒自然闭嘴;【三段视频必须使用同一光源、同一背景、同一服装,否则训练时会出现光影断裂或衣着错位】。
上传与训练环节关键操作
进入百度一镜控制台→「应用管理」→选择对应数字人项目→点击「形象克隆」→上传已拍摄的全身像视频文件(MP4格式,分辨率不低于1080p,时长不少于60秒)。
上传完成后,在「训练参数」中关闭「自动裁剪」选项,手动设置画面比例为9:16(竖屏)或16:9(横屏),并勾选「保留完整肢体结构识别」——此选项默认关闭,不勾选将导致系统按半身逻辑截取上半身区域进行建模。
提交训练任务后,等待约2~4小时生成结果,期间不可中断或修改参数。










