今年,具身智能迈入第三个年头,行业格局与趋势正迎来根本性转变。
机器人的本体,已成为当前市场最集中的关注焦点。从灵巧手、运动控制到整机结构设计,人形机器人持续突破物理性能边界——它们不仅登上春晚舞台,以行云流水般的舞蹈与武术表演震撼全球,更密集落地于工厂、物流、零售等真实场景,真正“进厂打工”,加速商业化进程。
然而,当机器人真正直面复杂多变的物理世界时,其深层瓶颈也愈发清晰:在动态环境、未知任务与连续交互中,机器人仍严重依赖人工示教与精细调参,虽四肢敏捷,却缺乏“走一步看三步、自主判断决策”的智能中枢。
一批更具远见的从业者已敏锐察觉这一症结,并着手破局。
今年以来,大量资本与技术资源正快速向世界模型(World Model) 与机器人基础模型(Foundation Model) 聚焦。据媒体统计,截至今年6月中旬,国内具身智能领域融资总额约达438亿元,其中超半数资金流向专注智能层研发的“大脑派”企业,聚焦基础模型、世界模型等方向;而传统本体厂商融资占比已滑落至不足15%。
全球科技巨头亦集体加码Physical AI:英伟达发布Cosmos世界基础模型及Isaac GR00T机器人智能体系;Google DeepMind推出Gemini Robotics,致力于打通机器人对物理世界的理解与动作执行之间的全链路能力。
机器人大脑的战略价值,正迅速凝聚为行业共识。
但共识,并不等于路径统一。
随着越来越多企业涌入机器人基础模型赛道,一个关键分歧浮出水面:机器人的“大脑”,究竟该延续大模型既有范式持续演进,还是应立足物理世界本质,重构底层逻辑?
面对这一分水岭,行业迅速分化为两条鲜明路径:一派沿袭大模型惯性,在通用架构上做迁移适配与局部微调;另一派则坚定主张——物理世界的数据逻辑与互联网截然不同,必须从底层架构、训练数据到预训练目标,全面推倒重建。
在具身智能迈向深水区的关键时刻,国内头部科技企业率先交出具有范式意义的答卷。
7月7日至10日,蚂蚁灵波连续发布六款大模型,覆盖视觉感知、空间理解、操作推理到世界建模的全栈技术层级。这不仅是一次高强度产品迭代,更是对“机器人基础模型应如何构建”这一根本命题的系统性回应。
更进一步,蚂蚁灵波正式提出“具身原生(Embodied Native)”全新技术理念,并于7月10日压轴推出 LingBot-VA 2.0 ——标志着其正以清晰的技术坐标,在具身智能下半场划出一条不可忽视的分界线。
01. 机器人进厂,暴露真正的瓶颈
本体,是过去两年无可争议的主旋律。
从机械结构、核心零部件到运动控制算法,行业围绕机器人“能动性”展开高速迭代:人形机器人从“能站立、能行走”,跃升至“能奔跑、能跳跃、能完成高难度协同动作”;越来越多企业走出实验室,在制造、物流、仓储、零售等一线场景开展规模化试点,一批批机器人走进真实产线,在展示技术实力的同时,也肩负起提升生产力的使命。
但当机器人真正嵌入真实环境,人们很快意识到:它并未真正“读懂”所处的世界。
即便经过海量真机示教与反复训练,机器人仍仅能精准复现预设流程。一旦遭遇持续变动的物理现实——传送带速度微调、桌面物品被意外挪动、货架位置发生偏移,甚至只是出现从未见过的障碍物,机器人便极易陷入停滞。
随之而来的是新一轮繁琐闭环:重新采集数据、重新示教、重新训练。
场景越开放、越复杂,“死记硬背”式能力的天花板就越早显现。
根源或在于技术范式本身。 当前主流采用模仿学习(Imitation Learning)等路径,依靠大量人类操作示范数据驱动机器人学习。该方式初期见效快,助机器人跨过产业化第一道门槛,也推动其加速进入真实场景。
但随着应用纵深拓展,真机数据采集成本陡增,且受限于样本规模与多样性,模型在陌生环境与新任务下的泛化能力,始终被示教数据的边界牢牢框定。
正因如此,越来越多研究者将目光投向世界模型(World Model)。
世界模型的核心思路,在于赋予机器人“预测环境演化”的内在能力,并将其深度融入决策机制。这意味着,面对瞬息万变的真实世界,机器人不再机械执行固化动作序列,而是能实时解析环境演变规律,像人类一样动态调整行为策略,实现真正意义上的自主进化。
然而,世界模型如何真正落地?现有技术困局又该如何突围?整个具身智能产业,正等待一个可复用、可扩展的新范式。
02. 当行业开始重新思考机器人大脑
ChatGPT 的爆发式成长,依托于互联网海量文本与图像数据;而机器人面对的,是一个具象、连续、遵循物理法则的真实世界——它需理解真实的因果律:推动一个箱子会滑行多远?抓起纸杯需施加多大压力才不会捏瘪?机械臂移动后,周围空间将产生何种反馈?
这些隐性物理规律,在互联网语料中并不存在,其获取高度依赖机器人与物理世界的主动交互。
依赖真机采集、遥操作示教所得的数据,不仅成本高昂、效率低下,其总量更远无法与互联网数据量级相提并论。若继续沿用“迁移+微调”的旧有路径,技术突破难度正呈指数级上升。
这正是蚂蚁灵波本周正式提出“具身原生(Embodied Native)”模型理念的深层动因。
在蚂蚁灵波看来,业内普遍将“机器人模型”视为大语言模型在物理世界的简单分支,这一认知存在根本性偏差——机器人应是一种全新的智能形态。既然学习对象已从文本转向物理世界,模型的起点就必须彻底重置:与其强行嫁接互联网大模型、做零敲碎打的适配,不如回归机器人真实任务需求,从零构建一套原生基础模型。
Gemini Notebook网页版是一款基于AI的智能笔记工具,其核心功能是让用户上传个人文档(如PDF、文本等),并以此为基础进行交互。它能针对你的资料进行总结、解答疑问、生成新内容,让信息处理更高效。该版本为在线使用,无需下载安装。
具体而言,“具身原生”将在三大维度与传统范式形成显著差异:
数据层面,模型的学习重心从互联网文本、图片,转向机器人在物理世界中采集的视觉信号、动作序列与环境反馈数据,使其真正接触并理解机器人作业的对象;
训练目标层面,关注点由内容生成转向“动作如何引发环境变化”,引导模型习得物理世界的因果逻辑,而非停留于视觉相关性的表层拟合;
模型架构层面,则紧扣机器人“实时感知—实时推理—实时控制”的运行节律,重构计算组织方式,确保模型满足真实机器人持续在线运行的严苛要求,而非沿袭内容生成模型的发展惯性。
这些差异看似分散于数据、训练、架构三个环节,实则统一指向同一内核:让机器人自诞生第一天起,就按物理世界的规则去学习、去成长。
这也正是蚂蚁灵波本轮六款模型发布的整体逻辑——以“具身原生”为纲,从空间感知、原生架构到物理交互数据,系统性重构机器人“看、想、干”的完整智能闭环。
首先是让机器人看得更准。蚂蚁灵波从传感器底层出发构建原生空间智能,以 LingBot-Vision 和 LingBot-Depth 2.0 为代表,为机器人装配适配物理世界的“原生双眼”。
其次是想得更透彻。蚂蚁灵波通过原生架构重塑模型学习范式:LingBot-Video 引入 MoE 架构,在模型规模与推理效率间取得平衡;LingBot-World 2.0 则通过因果预训练(Causal Pretrain)锚定物理合理性;而作为该架构的集大成者,压轴登场的 LingBot-VA 2.0 给出完整解法——语义分词器实现视觉与动作在统一空间的深度融合,因果预训练使模型从零建立对物理世界的认知,MoE 架构将推理开销严格控制在实时控制阈值内,Foresight Reasoning(前瞻推理)则实现预测与执行同步推进,消除等待延迟。
最后是干得更高效,这离不开原生数据支撑。作为面向真实任务执行的代表,LingBot-VLA 2.0 在产业落地反向驱动下,已开始兼容更多机器人构型与更高自由度关节。
从空间智能、原生架构到原生数据,六大模型层层递进、环环相扣。蚂蚁灵波不仅完整覆盖机器人“感知—理解—预测—行动”的全链条能力,更直击数据瓶颈,试图以这套原生全栈技术体系,开辟一条产业协同共建的新路径。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

03. 具身原生改变了机器人学习世界的方式
提出概念易,践行概念难。 LingBot-VA 2.0,正是“具身原生”理念最系统、最彻底的一次落地实践。
机器人如何学习,是LingBot-VA 2.0首先重构的起点。
过往多数机器人模型基于已有LLM或通用视频模型,通过迁移学习逐步适配任务。LingBot-VA 2.0则选择截然不同的路径——端到端全量预训练(Full Pre-training),以自回归视频生成模型为基座,直接让模型学习机器人在真实物理交互中产生的原始数据与内在规律。对机器人而言,这意味着它从出生起,就在与真实世界的环境、动作、反馈共同成长。
学习对象改变后,学习目标自然随之升级。
传统视频模型聚焦于“预测下一帧画面”,但这与机器人“执行有效动作”的终极目标并不一致。因此,LingBot-VA 2.0将建模重心转向动作与环境变化间的因果映射,让模型理解“我做了什么,世界因此如何改变”,而非仅仅观察“世界正在如何变化”。同时引入 foresight reasoning,使机器人在动作执行过程中持续推演未来状态,并依据环境新变化即时优化决策。在动态抓取、桌面交互、连续操作等任务中,机器人得以实现行为的实时自适应修正。
为支撑上述能力,模型架构本身也须围绕机器人运行逻辑重铸。
机器人不同于内容生成模型,无法容忍秒级延迟——它需要持续观测、持续推理、持续执行。为此,LingBot-VA 2.0采用MoE稀疏架构,在保障模型表达力的同时大幅提升推理吞吐;并创新引入异步推理机制,将环境感知、模型推理、动作输出三者解耦并行,实现“边推理、边执行”,避免因等待计算完成而错失最佳操作窗口。所有设计最终服务于同一目标——让机器人真正扎根于实时、连续、不可预测的物理世界。
最后被打通的,是“理解任务”到“完成动作”的神经通路。
长期以来,机器人领域存在典型断层:模型能听懂语言指令,却难以稳定、精准地将语义转化为对应动作。LingBot-VA 2.0通过新一代VAE技术强化语义与Action空间的对齐能力,使“理解”与“执行”之间建立更直接、更鲁棒的映射关系,让机器人不仅知道“要做什么”,更能准确、可靠地“做到什么”。
从端到端预训练、因果建模、MoE与异步推理,再到新一代VAE,四项技术看似独立,实则共筑同一目标:让机器人挣脱对固定动作模板的依赖,真正学会理解物理世界,并在持续变化的环境中自主完成任务。
这种范式转变,最终体现在实际能力上:LingBot-VA 2.0在新场景下仅需少量微调即可快速适配,支持动态抓取、桌面对抗、连续操作等高难度任务,在陌生环境中展现出更强的泛化性与鲁棒性。
04. 关于"机器人大脑"的讨论,才刚刚开始
回望“具身原生”理念提出的时机,并非偶然。
过去两年,机器人行业完成了本体能力的快速跃迁,大批机器人正加速走向真实产线;与此同时,业界也日益清醒地认识到:决定机器人长期竞争力的,不是单次任务完成精度,而是能否将每一次真实交互沉淀为可迁移、可复用的智能资产,能否实现跨机器人、跨任务、跨场景的持续学习与泛化。
背后还潜藏着一个尚未被广泛重视的深层矛盾:机器人没有属于自己的“互联网”。
大语言模型可依托无穷尽的互联网文本持续进化,而机器人获取真实交互数据的成本始终居高不下,数据规模天然受限。若此瓶颈无法突破,机器人智能的增长曲线终将遭遇结构性天花板。正因如此,围绕预训练范式、世界模型、机器人基础模型的新一轮探索,正成为行业竞争的新高地。
在此背景下,“具身原生”的价值,远不止于提出一个新概念,更在于它直指一个更本质的问题:当学习对象从互联网文本切换为物理世界,机器人基础模型是否也该拥有专属的设计哲学与技术范式?
从这个视角看,LingBot-VA 2.0代表着蚂蚁灵波首次系统性呈现了一条迥异于主流的具身智能发展路径——从感知、预测到执行,从模型训练到系统架构,全部围绕机器人如何理解、学习并作用于物理世界而展开。
这条路径是否会成为未来主流,当下尚无定论。但每一次技术范式的更迭,都始于对基础问题的重新发问与严肃讨论。
今天,当整个机器人行业开始聚焦、争鸣、反思“大脑”的构建逻辑时,蚂蚁灵波已率先亮出自己的答案。










