世界模型终于迈入实时新纪元。当业界仍在为5fps、10fps苦苦攻坚时,一支中国研发团队已将实时交互型世界模型推至50fps巅峰。尤为关键的是,全程未依赖英伟达gpu。
专注4d世界模型研发与产业落地的魔芯科技,携手浙江大学潘云鹤院士团队正式发布moworld——全球首个flash world model,亦是首个全栈基于国产npu构建的实时交互世界模型。
从模型训练、知识蒸馏到终端部署,完整打通国产算力闭环;推理成本较同等规模GPU方案直降70%。
世界模型产业化拐点,或比所有人预期更早到来。
横亘行业的实时瓶颈
被中国团队一举击穿
若你曾体验当前主流世界模型,大概率会有相似体会:
- 可视,却不可控;
- 机器人需毫秒级决策;
- 游戏需即时响应;
- 数字世界需连续推演。
已有研究指出:帧率低于30FPS,沉浸感即刻瓦解。
正因如此,世界模型长期滞留实验室,难以真正嵌入实际产业场景。
实时性,曾是阻隔世界模型商业落地的最后一道高墙。
如今,这堵墙已被一支中国团队彻底打破。
50FPS!
世界模型首次真正踏入实时纪元
技术白皮书已同步公开,开源权重与代码即将上线,并将依托国产NPU超节点面向公众开放服务。
技术白皮书:https://www.php.cn/link/4c47d46d8531966732133a9952d88db4
魔芯科技首创Flash World Model概念,MoWorld是业内首个实现>50FPS推理的「Flash World Model」,同时也是首个全栈基于国产NPU打造的低成本实时交互世界模型。
MoWorld首次在纯国产算力平台上完成训练→蒸馏→实时推理部署全流程贯通,在典型推理配置下,成本较同规模GPU方案降低70%。
当同行纷纷堆叠GPU时
他们坚定选择了一条更难却更本质的路径
MoWorld自立项起,便未以GPU为技术底座,而是毅然踏上一条更具挑战性、也更少人涉足的道路——全栈国产NPU架构。
这并非简单将模型迁移至国产芯片进行推理,而是从数据采集、模型训练、知识蒸馏到推理部署,每一环节均围绕国产NPU特性深度重构。
首先是数据层。
相较视频生成模型,世界模型不仅需视频与文本,更依赖相机运动轨迹等时空信息。互联网公开视频远不能满足训练需求。
为此,MoWorld构建了端到端的数据生产与治理体系,并将其升级为专用于世界模型的智能数据引擎。
依托魔芯科技多年深耕3D/4D建模的技术积淀,MoWorld背后的数据产线为全自主采集、全三维标注体系——不仅标注相机位姿,更精确标注物体几何尺寸与空间拓扑结构,构筑起MoWorld坚实的数据地基。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

而更具挑战性的突破,则发生在训练与推理两大核心阶段。
针对国产NPU硬件特性,MoWorld全新设计训练系统,引入超密集注意力并行机制、长序列Token并行调度等关键技术,显著缓解超长视频训练带来的显存压力,使世界模型首次具备2000帧级长时序建模与推理能力。
进入推理阶段,团队进一步开展流水线执行优化、层级化序列并行调度、动态混合精度量化等系统级深度调优。


最终,一个14B参数的MoE世界模型,在华为Ascend 910C CloudMatrix384 NPU平台上达成极限性能——实时推理速度突破50FPS。
更关键的是,在典型推理配置下,推理成本较同规模GPU方案下降70%。
对整个行业而言,这不仅开辟了一条全新工程路径,更重塑了一种全新的产业化范式。
世界模型最昂贵的那扇门,已被推开
长久以来,世界模型发展始终面临一对尖锐矛盾:
模型能力持续跃升,
部署成本却水涨船高。
过去,运行一个世界模型,意味着巨额GPU投入、复杂集群运维,以及极高的定制化部署门槛。
而今,同等能力的世界模型,可稳定运行于更具性价比的国产算力平台之上。
这不仅重构了模型运行方式,更重写了世界模型走向产业化的路线图。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
对企业而言,意味着更低的接入门槛、更快的验证周期,以及更易复制的规模化应用路径。
对整个产业而言,意味着世界模型正从“理论上可行”,迈向“实践中可用”,再迈向“经济上可持续”。
真正驱动一项技术重塑产业的,从来不是实验室里的峰值指标,
而是它第一次,让千行百业真正用得上、用得起、用得好。
世界模型走出实验室
哪些领域将率先迎来变革
过去数年,世界模型常被视为“未来技术”。
但未来,终须扎根现实。
当实时交互成为标配,当部署成本大幅回落,世界模型的真实价值,才刚刚开始释放。
最先被重塑的,将是那些高度依赖物理世界理解与毫秒级反馈的关键领域。
游戏与互动娱乐:真·自由漫游,实时交互
MoWorld全面支持6自由度相机控制,用户仅需W/A/S/D键与鼠标即可实现影视级、游戏级沉浸式探索体验。
画面真实细腻、分辨率达1080P及以上,覆盖自然景观、二次元风格、游戏动漫等全类型内容。
具身智能与自动驾驶:虚实融合,高效训练
世界模型已成为生成式AI通向具身智能的核心枢纽。
MoWorld可为机器人、自动驾驶系统提供低成本、高保真的“数字训练场”,是当前兼具仿真精度与经济可行性的最具潜力世界模拟器,能为所有智驾研发团队持续输出海量、高保真、多维度环境样本,助力AI在虚拟空间中习得与真实物理世界交互的能力。
影视创作:导演视角,所见即所得
传统分镜制作需耗费漫长渲染周期。
MoWorld让创作者能在生成的虚拟世界中自由调整机位、实时预览成片效果、精准操控镜头构图,运镜流畅自然,支持突破常规想象边界的导演级镜头语言。
数字孪生与三维重建:空间感知,毫米级还原
MoWorld生成视频具备行业领先的几何一致性,可直接用于室内场景三维重建——精度更高、结构更稳、空间关系更准确,构成MoWorld区别于竞品的核心优势。
为数字孪生、建筑可视化、虚拟展厅、沉浸式游戏等场景,提供高精度与高性价比兼备的终极解决方案。

MoWorld所代表的世界模型
此刻正站在物理AI的DeepSeek时刻
过去几年,AI完成了从文本生成、图像生成到视频生成的三级跃迁,每次技术突破,都催生新一代行业领导者。
而当AI迈向实时交互世界模型,一扇全新窗口已然开启。
相比已形成激烈竞争格局的大语言模型与视频生成模型,世界模型仍处产业化早期,全球尚在探索工程化落地路径,行业标准尚未确立。
这意味着,国产世界模型迎来罕见的“同一起跑线”机遇——不仅有望参与全球竞争,更有潜力主导下一代空间智能技术标准的制定权。
MoWorld的价值,远不止于达成50FPS实时交互,也不止于推理成本下降70%。
其深层意义在于,它首次以完整工程实践验证了一个此前悬而未决的关键命题:
全栈国产算力,完全有能力支撑世界模型实现真正的实时交互与规模化产业部署。
这意味着,世界模型的竞争焦点,正从“谁拥有最大参数量”,转向“谁真正走进真实世界”。
MoWorld背后的魔芯科技,凭借其独特的模型架构能力与扎实的产业化进展,近期成功获得国家级战略储备资本、中东头部美元基金、国内顶级市场化基金及十余家产业资本联合投资,融资额逾亿美元;在此前,魔芯科技已获华为哈勃投资、联想控股旗下基金的战略加持。
真正属于世界模型的时代,始于Flash World Model,正加速奔来。
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。










