7月3日,在2026全球数字经济大会人工智能融合应用发展论坛上,生数科技创始人朱军发表了题为《通用世界模型,推动数字世界与物理世界统一的新范式》的主旨演讲,并正式推出面向实时交互场景的全新一代模型——vidu s1实时交互模型。同期,北京软件和信息服务业协会(bsia)发布《2025年北京市数字经济标杆企业评价报告》,生数科技凭借在核心技术突破与产业落地实践中的显著成果,成功入选“新模式新应用标杆企业”。

Vidu S1 实时交互模型,开创性地赋予AI视频以“边说边演、边听边动”的动态交互能力,标志着AI视频生成正从“一次性内容产出”,全面升级为“持续性双向对话”。
该模型原生支持实时音视频通话与语义级语音指令驱动,用户可通过自然语言实时调控数字人的行为逻辑、情绪表达与剧情走向,实现真正意义上的无限时长、无缝衔接的连续交互。同时,Vidu S1具备540P(960×540)高清画质输出能力,标准帧率达25FPS(峰值可达42FPS),兼容真人、二次元、萌系宠物等多元视觉风格,并支持个性化音色定制,仅需单张图像即可快速构建专属可交互角色,带来更真实、更丝滑、更具临场感的沉浸式体验。
语音指令毫秒响应:从“离线渲染”迈向“在线理解”,让数字人真正“听清、听懂、听准”
传统视频大模型普遍依赖“输入提示→静默生成→播放结果”的串行离线流程。一旦视频生成完成,其内容即固化,若需修改动作、切换场景或调整节奏,必须中断交互、重写提示词、重新排队生成,人机关系仍停留在单向“创作—观赏”层面。
Vidu S1 全面重构这一范式。在视频流持续播放过程中,用户可随时插入语音指令,模型将同步融合当前语音语义、上下文对话历史及画面动态状态,即时生成连贯、合理、风格一致的后续帧序列,实现真正的“所见即所得、所说即所动”。
更进一步,Vidu S1 推动数字人交互能力跃迁:不再局限于“语音驱动口型”的浅层映射,而是实现“语音驱动行为”的深度理解。区别于依赖预设动画库与音频波形对齐的传统方案,Vidu S1 基于端到端实时视频生成架构,将语音信号升维为涵盖意图识别、情感解析与动作规划的综合控制指令。它不仅能精准匹配唇动节奏,更能同步生成契合语境的眼神变化、微表情流转、手势起落及全身姿态演化,使数字人由“能开口的虚拟壳体”,蜕变为“可共情、会思考、能应变”的生成式智能体。

无限时长动态演进:让视频在交互中自主生长、实时进化
主流视频生成模型通常受限于固定时长约束,单次输出多为3秒至30秒的封闭片段,中间无法插入干预,亦难以维持长时间一致性。
Vidu S1 采用自回归扩散(AR+Diffusion)混合架构,摒弃“全量一次性生成”模式,转而基于已生成的历史帧序列,结合最新语音输入与对话记忆,逐帧预测并延伸视频内容。当用户发出“转身微笑”“指向屏幕右侧”“语气严肃些”等指令时,模型可在毫秒级内完成语义解析,并实时调整角色神态、肢体语言与镜头逻辑,使整段视频不再是静态脚本的复现,而成为随用户意志不断延展、动态适配的活态交互流。

除实现超长时序下的稳定生成外,Vidu S1 还首次达成数小时级连续运行不漂移、不崩坏、不卡顿的技术突破。这不仅要求模型具备强大的长期记忆建模能力,更需在身份一致性、动作物理合理性、交互响应及时性三者间取得精妙平衡——Vidu S1 在实测中展现出卓越的跨时段角色稳定性与自然流畅的动作衔接能力,率先兑现“永远在线、始终鲜活”的生成式交互承诺。
零门槛角色创建:一张图即启实时互动,告别繁琐建模与训练周期
传统数字人构建流程复杂冗长:需采集多角度图像或视频素材,经历三维建模、骨骼绑定、口型驱动适配、动作迁移训练等多个环节,开发周期动辄数天甚至数周。
Vidu S1 彻底重构角色生产链路,采用纯生成式技术路径,无需任何离线建模、绑定或微调训练。用户仅需上传一张清晰正面图像,模型即可自动解析其面部结构、风格特征与视觉语义,实时合成符合身份设定的口型、微表情、眼神焦点、手势逻辑与全身运动力学,实现“上传即用、开图即聊”。
无论真实人物、国风动漫、Q版IP还是拟人化宠物,均可在秒级内转化为具备完整交互能力的生成式角色;配合音色克隆与声纹对齐技术,视觉形象与声音人格实现高度统一,真正打通“形”与“声”的协同表达。

540P × 25FPS 视频通话级实时性能:不止于“快”,更在于“稳”与“准”
实时交互对生成质量提出双重严苛要求:既要保障高分辨率与高帧率的视听体验,又需满足低延迟、高稳定性、强一致性的系统级指标。
Vidu S1 面向真实业务场景深度优化,在模型推理与服务部署两个维度实现协同突破,达成540P分辨率下25FPS(峰值42FPS)的可持续流式输出能力。
在模型侧,依托生数科技自研TurboDiffusion[1]推理加速框架,集成少步采样、8位高保真注意力机制SageAttention[2]、可调稀疏线性注意力SLA[3]及免训练稀疏注意力SpargeAttention[4]等多项前沿技术,大幅压缩单帧生成算力开销,使得消费级GPU亦可支撑高质量实时生成。
在系统侧,基于TurboServe[5]流式推理服务平台,Vidu S1 实现请求智能调度、状态持久化管理与资源弹性伸缩。系统全程追踪用户语音流、角色状态图谱与历史画面缓存,并依据交互强度与复杂度动态分配计算资源,确保高并发下依然保持低抖动、低丢帧、高响应的工业级稳定性。

540P与25FPS,早已超越单纯的技术参数,成为实时视频生成迈入实用化阶段的关键里程碑——它意味着Vidu S1已具备无缝嵌入视频通话、互动直播、AI陪伴、游戏NPC、品牌数字分身、智能客服、虚拟课堂及XR空间等多元场景的工程可行性。
随着视频大模型竞争重心由单一画质、时长、速度等维度,转向实时性、可控性与交互性的系统级比拼,Vidu S1 的发布,正将AI视频从“被观看的内容”,重塑为“可参与的世界接口”。
未来,Vidu S1 将深度赋能AI情感陪伴、虚拟偶像运营、实时互动电商、游戏智能体、企业数字员工、AI教学助手及空间计算终端等广阔领域,推动数字角色由“一次性内容资产”,进化为“长期在线、主动感知、持续成长”的下一代智能交互入口。
从生成一段影像,到孕育一个生命般的交互主体;从单向内容交付,到双向意义共建,Vidu S1 正在重新定义视频大模型的能力边界,引领AI视频生成正式步入实时交互的新纪元。
Vidu S1 已启动限量内测,欢迎体验自定义角色与实时语音互动:
线上体验地址:https://www.php.cn/link/ff129fecec3ab81ec6c17f95fe2dc11b
API 开发者入口:https://www.php.cn/link/bc4586081f58bd9127939f420a298dc0
移动端体验:请前往各大应用商店搜索「Vidu AI Pro」下载最新版App,进入首页点击「Vidu S1」专区即可开启实时交互之旅
[1]TurboDiffusion: Accelerating Video Diffusion Models by 100–200 Times.
[2]SageAttention: Accurate 8-bit attention for plug-and-play inference acceleration.
[3]SLA: Beyond sparsity in diffusion transformers via fine-tunable sparse-linear attention.
[4]SpargeAttention: Accurate and training-free sparse attention accelerating any model inference.
[5]TurboServe: Serving Streaming Video Generation Efficiently and Economically.









