实时交互与实时编辑双引擎驱动,Vidu S2正式发布即开放体验
AI 视频正加速演进为一个“边播、边演、边改”的实时系统。例如,开启摄像头后,只需点击一张参考角色图,即可瞬时替换视频中的人物形象,动作节奏丝毫无损;与虚拟人对话时,一句“跳个舞”,角色立刻响应,肢体舒展自然,情绪饱满流畅。更进一步,就像修图一样,摄像头捕获的真人视频流也能实现“边拍边修”——在完全保留原始姿态、运动节律与镜头逻辑的前提下,实时切换画风、更换人物或更新背景。
视频地址: https://www.php.cn/link/8df71b1a941cf3ed804e8b1d89f9c426
视频地址: https://www.php.cn/link/8df71b1a941cf3ed804e8b1d89f9c426
这正是生数科技全新推出的 vidu s2——一套专为实时交互与实时编辑深度优化的视频生成模型体系,全面覆盖实时数字人、离线数字人及实时视频编辑三大核心场景。
其中,S2-Avatar 聚焦实时数字人的“沉浸式表演”,支持 720p 分辨率、25~42 FPS 高帧率输出,不仅能精准还原说话微表情,更能稳定驱动舞蹈等全身性大幅度动作;尤为关键的是,它支持在生成过程中动态插入新元素:一张服装图、一件道具照、一个场景参考,都能即时融入正在播放的视频流,实现“演着演着就换装”“说着说着就入场”的无缝衔接。
而本次最引人瞩目的升级,则是 S2-Editing ——首个面向连续视频流的实时编辑模型。它持续接收来自摄像头或已有视频源的输入流,并让新指令(如文本提示+参考图)即时生效于后续画面:人物抬手时风格同步变化,转身时服装纹理自然延展,镜头推进时背景空间关系始终稳固。所有编辑均严格维持原有姿态、肢体轨迹、运镜逻辑与时间顺序,真正实现“所见即所得”的视频流式重塑。
此外,S2-Avatar [Offline] 面向批量内容生产,支持基于图片、文案或音频,批量生成动作节奏可控、口型时间点精准匹配的数字人口播视频,兼顾效率与表现力。
这些能力并非概念演示,而是已落地的产品级能力。发布前夕,生数团队同步公开技术论文,详述实时数字人建模、流式视频编辑机制与空间视频生成路径;发布当日即开放网页体验与 API 接入,邀请全球用户共同参与迭代共创。
体验链接: https://www.php.cn/link/599a318840a9f0acba0e40c9f56bfc92
API 平台: https://www.php.cn/link/29ed3d416cd513893ea80d1e6c9a560e
技术报告: https://www.php.cn/link/657989c9751e4f61cbf730c67ae15d4e
从 Vidu S1 论文于 7 月 3 日提交,到 S2 论文于 9 月 10 日正式公开,仅间隔约 69 天——如此紧凑的迭代节奏背后,是控制维度、输出质量与实时深度的三重跃迁:控制对象从静态数字人扩展至动态参考图与完整视频流;分辨率由 540p 升级至 720p;动作能力从基础口型扩展至全身舞蹈;实时链路更延伸至左右眼同步的空间视频生成。
如果说 S1 实现了数字人在生成过程中的“实时对话”,那么 S2 则真正开启了“实时共演”时代:当角色大幅运动、用户持续追加新素材、输入本身已是连续视频流时,系统能否依然做到及时响应、稳定承载、精确执行?Vidu S2 给出了肯定的答案。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

生数科技于9月15日正式发布了全新的 Vidu S2视频大模型系列。本次发布的 Vidu S2包含两个核心模型:面向持续交互数字角色生成的 Vidu S2-Avatar,以及面向输入视频流进行实时编辑的 Vidu S2-Editing。在此基础之上,生数科技还进一步探索了面向 VR 头显的实时空间视频生成与编辑能力。整个全链路研发由朱军教授的博士生、生数科技流式视频生成与推理负责人张金涛负责。
在模型特色方面,Vidu S2-Avatar 实现了从语音持续控制到更高交互自由度的跨越。用户上传一张角色图片后,即可通过文本或语音与模型互动,模型不仅支持说话时的表情与姿态,还增强了舞蹈等大幅度动作的指令跟随能力。更重要的是,该模型支持在视频流进行中的任意时刻动态加入物品、服装或背景参考图,让角色在互动中拿起杯子、换上指定服装或进入新场景。同时,模型引入了视觉反馈机制,确保诸如“拿起杯子然后微笑”等连续动作与状态保持的可靠性。此外,S2-Avatar 将实时输出分辨率从上一代的540P 提升至720P。

Vidu S2-Editing 则专注于接收持续输入的视频流,并根据文本指令和可选参考图进行实时编辑,让画面跟随人物抬手、转身或镜头移动自然变化。目前该模型主要支持四类任务:一是风格迁移,在保留人物轮廓、姿态和场景布局的同时改变画面笔触与色彩;二是虚拟试穿,将参考服装迁移到视频人物身上,精准处理服装边界、材质纹理及肢体遮挡关系;三是人物替换,将参考角色的面部、发型、服装和外观整体迁移至源视频,同时保留原有姿态与运动;四是背景替换,根据参考图更换环境并在人物持续运动时保持稳定的空间关系。
在空间视频探索方面,Vidu S2将 Avatar 的实时输出接入空间视频转换流程,生成同步的左右眼视图;Editing 则支持先编辑普通单目视频再转换为空间视频,或直接编辑已有的空间视频,且两类模式均支持上述四类编辑任务,相关结果可流式传输至 VR 头显。
在底层技术选择上,Vidu S2进行了多项关键技术创新。首先是提出了 Self-Replay Forcing(SRF)训练方法,模型先生成较长的自生成轨迹,再从中采样连续片段重新加噪并进行可传播梯度的因果重放训练,有效避免了小误差累积导致的身份漂移或动作断裂。其次在数据处理上,兼顾了舞蹈视频的动作丰富度与画面稳定性,并采用事件顺序描述的视频标注和偏好奖励优化。同时,S2-Avatar 引入了 VLM 智能体作为视觉反馈,用于检查动作完成情况并调整后续提示词。在性能与效率优化方面,采用轻量级单步 Refiner 恢复高分辨率细节,结合 TurboDiffusion 与 TurboServe 技术降低计算开销,实现各模块共享时间线调度。
在公开与专业评测中,Vidu S2展现了出色的综合性能。在 StreamAV-Bench 评测中,S2-Avatar 在视觉与音频质量、音画对齐及主体背景一致性等9项指标上均取得最优。在视频编辑方面,S2-Editing 在 OpenVE 与 RefVIE 联合评测中取得4.26分,在 Sparkle-Bench 上各项指标均为最优,并在 ViViD 虚拟试穿测试及多项专业人工偏好对比中大幅超越同类模型。
谈及未来规划,生数科技表示空间视频目前仍处于固定视角探索阶段,如何在头显中保持清晰画质并进一步降低延迟、探索全景空间视频将是接下来的核心攻坚方向。
体验网址:https://www.php.cn/link/04159afa219c56abc29eca1a8dc018dd











