5分钟内可完成数字人口播视频制作:先用30秒全身视频和30秒原声训练专属形象(需8分钟),之后输入文案即可一键生成口型同步、声音自然的mp4视频,支持小剧场快捷生成或ai生视频精细控制。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用千问AI快速生成一段带数字人出镜、口型同步、声音自然的口播视频,不用真人露脸、不需剪辑软件、不依赖专业设备,只要一段文案就能出片——整个流程从输入文字到下载成片,5分钟内可完成。
准备专属数字人形象(仅首次需操作)
这一步是后续所有口播视频能“像你”的前提,必须提前完成,否则无法调用本人音色和面部特征。系统需要你提供两段原始素材:一段30秒全身出镜视频 + 一段30秒原声朗读音频。
第一步:打开千问APP → 点击右上角「格子图标」→ 选择「数字人克隆」模块。
第二步:按提示录制全身视频——站在光线均匀的室内,平视镜头,自然抬手、转头、轻微说话即可,【不要背台词、不要穿反光衣物、不要戴口罩】,否则AI抓取不到微表情与唇部运动轨迹。
第三步:同步录制原声音频,用手机备忘录或录音App朗读任意一段文字(如“今天天气不错,适合出门散步”),语速正常,环境安静无回声。
第四步:上传两段文件 → 点击「开始训练」→ 等待约8分钟,系统自动生成你的专属数字人形象与音色模型。训练完成后,该形象会永久保存在个人资产库中,下次直接调用。
用文字一键生成口播视频
已有数字人形象后,每次口播只需输入文案,全程无需再录视频或配音。
方法一:走「小剧场」快捷路径(适合15秒以内单人讲解)
打开千问APP → 底部导航栏点「小剧场」→ 在输入框粘贴口播文案(例如:“大家好,今天教你怎么三步搞定Excel自动求和”)→ 点击「生成」。
系统自动匹配你已克隆的数字人形象、调用原声音色、驱动口型与微动作,60秒内输出MP4成片,支持直接导出无水印高清视频。
方法二:走「AI生视频」精细控制路径(适合多镜头/带BGM/需节奏微调)
点击首页「AI生视频」卡片 → 选择「文生视频」→ 在提示框中输入结构化指令:“数字人张伟(你的名字),穿浅蓝衬衫,面带微笑,站在简约办公室背景前,逐句说出以下文案:……” → 后续文案直接换行粘贴。
关键设置:关闭「智能音效」,开启「口型同步」,时长设为10秒,分辨率选720p → 点击「立即生成」。
生成完成后,播放预览时重点检查第3–5秒的口型咬合是否自然——若发现“啊”“哦”等开口音错位,说明文案中存在过多顿号或括号,需删减标点后重试。
导出与使用
生成视频默认保存在APP本地缓存中,点击右上角「下载」图标即可无水印保存至手机相册。
如需上传B站或抖音,建议先用剪映导入该视频 → 点击「文本」→「智能字幕」→ 自动识别并校对字幕 → 导出时勾选「硬字幕」,避免平台自动OCR识别错误。











