度加ai通过数字人与声音克隆功能实现文字一键生成口播视频。用户需上传正脸证件照创建数字人形象,录制或上传音频克隆声音,再输入文案即可生成带真人形象和本人音色的视频。

想快速制作口播视频但苦于没有出镜人员、配音不专业、剪辑耗时长?度加AI新上线的数字人与声音克隆功能,能直接用文字生成带真人形象和本人音色的视频,跳过拍摄、录音、对口型等全部中间环节。
创建专属数字人形象
打开度加AI官网,登录百度账号后点击「创作中心」→「数字人」→「新建数字人」。
上传一张正脸清晰证件照(背景纯色、无遮挡、光线均匀),系统会在3分钟内生成4个可选形象;若首张照片识别失败,页面会自动提示“建议更换为蓝底免冠照”,此时【必须重传符合要求的照片,否则后续所有形象驱动都会异常抖动】。
从生成的四个形象中任选一个,点击「确认使用」即完成绑定。
克隆自己的声音
方法一:在「声音克隆」页点击「立即录制」,按提示朗读屏幕上随机出现的5段指定文本(每段约12秒),全程保持环境安静、手机/麦克风距离嘴部20cm以内。
方法二:上传已有的高质量音频文件(格式MP3/WAV,时长≥60秒,人声纯净无背景音乐),系统将自动提取声纹特征。
注意:两种方式均需确保语音中无长时间停顿或重复纠错,否则克隆出的声音会出现断续或语调扁平。
输入文案生成口播视频
第一步:在「创作」页选择已创建的数字人与已克隆的声音模型。
第二步:在文本框中粘贴或手动输入口播文案(建议单次不超过800字,超长文本会导致数字人口型不同步)。
第三步:点击「生成视频」,等待1~3分钟,预览无误后点击「导出高清」即可下载MP4文件。











