世界模型,无疑是当下ai领域最炙手可热、也最具争议性的方向之一。
它的定义尚未统一、技术路径尚未定型、训练范式尚未成熟、数据规范尚未确立、评估体系尚未共识……
7月19日,在WAIC“世界模型六小龙”主题论坛上,一场高密度、高强度的思想交锋如期展开——六家头部具身智能企业的世界模型技术负责人齐聚一堂,展开深度对谈。他们分别是:
大晓机器人首席科学家陶大程(主持人)
蚂蚁灵波首席科学家沈宇军
极佳视界联合创始人&首席科学家朱政
无界动力联合创始人兼CTO夏中谱
智元机器人AI算法总监任广辉
自变量机器人联合创始人兼CTO王昊
这些一线实践者的声音,折射出当前产业界对世界模型最鲜活、最真实的认知图谱,极具参考价值。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

哪些能力真正关键?
共识容易罗列,分歧才值得深挖。
先看技术路线的分野。
六家公司当前主攻的方向,若以“模型在何种空间中建模并推演世界动态”为标尺,大致可划分为三类:
像素生成派:代表为极佳视界
隐空间(JEPA)派:代表为无界动力
融合派:包括大晓机器人(主张理解-生成-预测一体化)、蚂蚁灵波(已构建多技术路线并行的世界模型矩阵)、自变量机器人、智元机器人
因底层范式不同,各团队对核心命题的理解自然存在张力。
例如:世界模型究竟需要多深的物理世界建模能力?
一方倾向向高保真物理模拟器靠拢。
无界动力的夏中谱强调,衡量世界模型优劣的核心维度,在于其对几何结构、运动轨迹、力学响应等底层状态的预测准确度。
另一方则主张“够用即合理”。
蚂蚁灵波的沈宇军提出,“物理合理性”远比“物理精确性”更贴近真实需求。机器人只需知道铁块比棉花下落更快,但无需精确计算加速度差值;它只需识别哪些物理差异会实质性影响当前动作,而非复现全部物理参数。
关于能力评估标准,观点同样多元。
智元的任广辉指出,长时程物理一致性推理能力,是检验世界模型是否具备真正物理智能的关键指标之一。
而自变量的王昊则直言:长程推演实为“伪命题”。相较而言,他更关注推理的时效性——若预测耗时过长,导致错过决策窗口,再完美的推演也失去意义。
这些表面对立的观点背后,实则是各家模型能力边界的自然映射:
隐空间建模可直接回归物理量,因而敢于追求精度;
像素级生成天然侧重视觉合理性,故更强调“看起来对”;
至于长时一致性,智元将世界模型深度耦合进仿真系统,长程推演是其核心功能;而自变量将其与VLA端到端整合,预测本身即动作生成的前置环节,预测跨度越长,推理延迟越高,挤占的实时决策资源就越多。

哪些要素将率先达成共识?
除了技术路径之争,一个更务实的问题浮出水面:世界模型生态中,哪一部分最可能率先收敛?
各方判断不尽相同。
任广辉与夏中谱押注于统一表征。语言模型已确立token为基本单元,而具身智能尚缺自己的“原子单位”——视觉、语言、动作等多模态信号亟需映射至同一语义空间,完成跨模态对齐。
王昊更看好架构融合趋势。视频生成提供未来帧预测能力,隐空间建模支撑高效因果推理,3D显式表征承担空间记忆功能,取长补短拼装新范式——这正是大语言模型发展史中反复验证过的进化路径。
沈宇军则坚定看好触觉模态的突破性地位。他认为,行业将在短期内形成明确共识:触觉将成为机器人不可或缺的感知维度。一旦高质量触觉数据实现规模化获取与建模,数字世界衍生的世界模型与物理世界原生的世界模型,将正式走向两条不可逆的发展轨道。
目前多数机器人世界模型仍脱胎于视频生成模型;而蚂蚁灵波正着力构建“具身原生”的世界模型——从控制闭环的实际需求出发,采用自回归架构进行端到端预训练,目标是服务“边预测、边行动”的实时决策,而非生成高保真视觉画面。
陶大程则认为,短期收敛点不会落在某条技术路线上,而更可能出现在横向的评测基准上。
他援引深度学习崛起的历史:ImageNet并非靠理论辩论胜出,而是以统一标尺将所有方法置于同一平台较量。评测一旦标准化,收敛便水到渠成。
大晓机器人在本次论坛同步发布PHYSICAL IQ——首个面向多场景、多本体、多任务的具身原生物理智能评测基准平台,旨在公平量化不同机器人本体与世界模型在真实物理环境中的综合智能水平。

从Demo迈向规模化落地
尽管技术路线各异,但当机器人真正进入物理世界,终极评判标准终将回归朴素:它能否稳定、可靠、持续地完成任务?
夏中谱称之为“决策有效性”;
任广辉侧重技术表达:“最终为策略(policy)带来多少性能提升”;
朱政则直指结果:“多任务真机运行成功率”。
名称虽异,内核一致。
单个Demo跑通不难——为一次演示可以无限堆资源、调参数、控环境;
真正的挑战在于真实场景下的规模化部署(Deployment)。
王昊指出一个关键规律:模型能力从90%提升至99%,再从99%跃升至99.9%,所需投入绝非线性增长。
实验室中看似微小的错误率,在产线现场可能演变为频繁人工接管、反复返工调试,最终拖垮整体ROI。
此外,应对随机性与突发状况的能力,是机器人走出实验室前必须补上的关键一课。
沈宇军以商超场景为例:机器人需定位一包蔬菜,顾客却随手将其塞入牛奶冷柜。单次事件或属偶然,但对每日接触数百位陌生用户的机器人而言,这就是常态。
大晓机器人陶大程特别强调端侧推理能力对落地成败的决定性作用。
当前许多世界模型依赖云端部署,但机器人留给自身做判断的时间窗口往往仅几十至几百毫秒。网络无法永远在线,云端也无法永远待命。
他说:“最难的不是让模型变聪明,而是让聪明变得廉价、鲁棒且即时。”
一句话总结:Demo展现的是能力上限,Deployment考验的是能力下限。
最后,还有一个值得回望的问题:世界模型今年上半年才真正爆发,若两年后再看,今天哪些选择是对的,哪些可能是弯路?
沈宇军提醒:行业常混淆“模型内在能力”与“模型外显表现”。前者指泛化效率、交互友好性等本质属性;后者如图像生成质量等表面输出。
他判断:所有夯实模型底层能力的工作都做对了;但过度追逐外显效果,未必经得起时间检验。所有围绕数据链路的系统性建设也都做对了;但当前积累的数据能否被后续模型真正使用、能否持续迭代更新,仍有待观察。
朱政指出:在基础模型尚未收敛的阶段,过早铺开大量商业化场景探索,大概率事倍功半。
任广辉预测:两年后,世界模型将加速转向“具身原生”——不仅需要更大规模的具身原生数据集,更需要专为具身交互设计的原生模型架构。
这场持续约一小时的圆桌讨论,覆盖了世界模型当前最核心的议题,清晰呈现了产业界现阶段最具代表性的共识地带与分歧焦点。
陶大程的结语尤为精辟:分歧是论文的燃料,重叠才是产业的基石。 对整个行业而言,分歧不是障碍,恰恰是当下最宝贵的红利。
本文来自微信公众号“量子位”(ID:QbitAI),作者:林方舟,36氪经授权发布。











