seko可3分钟内将口播稿一键生成带口型同步的短视频:粘贴文字→选数字人→定画面风格→自动合成。需用“数字人视频”模板,禁用自动场景匹配,必设基准角色并逐段验证口型对齐。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

用Seko把一段口播稿做成短视频,不需要写提示词、不手动配乐、不拆分镜头,只需粘贴文字→选声音→定画面风格→一键生成,3分钟内出带口型同步的成片。
上传或粘贴口播稿
登录 seko.sensetime.com 后点击「新建项目」→ 选择「数字人视频」模板 → 在输入框中直接粘贴你的口播稿,比如:“大家好,今天教三个厨房去油小妙招,第一……”
这一步不能选“短视频创作”或“AI短剧”模板,否则系统会强行拆解剧情、添加角色和场景,导致纯口播内容被错误演绎。数字人视频模板专为单人讲解、知识科普、产品介绍类内容设计,会默认聚焦说话人主体。
绑定数字人并调整口型
方法一:使用系统预设数字人
点击「选择数字人」→ 在「推荐」栏任选一个形象(如“知性女声-林薇”)→ 点击「设为当前主体」。
方法二:上传真人照片定制数字人
点击「上传照片」→ 选一张正脸、光线均匀、无遮挡的半身照→ 等待15秒生成专属数字人→ 【必须点击“设为基准角色”】,否则后续口型驱动会偏移,嘴动和声音不同步。
确认数字人后,右侧配音栏自动加载对应音色;若需更换,可下拉选择60种真人音色,支持调节语速(建议0.9–1.1倍)、情绪(如“亲切”“专业”“活泼”)。
配置画面与背景
第一步:选画幅与分辨率
在右上角「项目设置」中,竖屏口播选9:16,横屏课程选16:9;新手导出先用720P,节省积分且加载快。
第二步:定背景风格
点击「背景」→ 可选纯色(推荐浅灰/米白,显专业)、动态模糊(虚化杂乱环境)、或上传自定义图片(如品牌LOGO墙、办公桌实景);【禁用“自动匹配场景”】,该功能会根据稿中词汇插入无关画面(如稿中提到“冰箱”,背景可能突兀弹出厨房全景)。
第三步:加文字标点(可选)
点击「文字」→ 开启「智能字幕」→ 字体选“思源黑体 Medium”,字号适配画面(9:16下建议48pt),位置固定在画面下方1/5处;若口播含重点数据,可手动在对应句子旁添加浮动标签,比如“✅ 30秒见效”。
生成并修复口型
① 点击右上角「一键转视频」→ 系统自动合成数字人动作、口型、语音、背景,耗时约40–90秒。
② 预览时逐句检查口型:拖动时间轴到“第一招”处,观察嘴唇开合是否与“第”“一”“招”三字严格对应。
③ 若发现滞后(如声音已说“第二招”,嘴还停在“第一招”末尾),立即返回该时间点→ 点击分镜轨道上的「重做口型对齐」→ 选择当前配音轨道→ 等待5秒重算。
这一步不可跳过——口型偏差超过0.3秒,观众会明显感到“假”,尤其在近景镜头中。Seko的口型修复仅作用于当前分镜,不影响前后句,所以必须逐段验证。
导出最终视频
预览无误后,点击「导出视频」→ 选择1080P(需消耗50积分)或720P(免费)→ 勾选「保留原始音频轨」便于后期降噪→ 点击「开始导出」→ 下载MP4文件。











