2026 年 7 月 17 日,世界人工智能大会(waic)在上海世博中心隆重启幕。作为全球瞩目的年度 ai 盛事,waic 就像一场面向整个行业的“能力摸底考”:大模型厂商、ai 芯片设计方、智能终端品牌以及具身智能企业悉数亮相,纷纷将本年度最具代表性的技术成果与落地产品带到申城。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

图片来源:雷科技
为深度追踪 AI 领域最新演进趋势,雷科技(ID:Leikeji)今年再度组建一线报道团队奔赴上海,直击现场,带来一手行业观察与前沿洞察。
一如往届,大模型仍是 WAIC 的核心关键词:Kimi 在大会开幕前夕正式推出参数量达 3T 的 K3 模型;面壁智能持续深化 MiniCPM 在边缘设备的部署,推动智能真正下沉至终端侧;阶跃星辰、豆包、荣耀等厂商则加速将大模型深度集成进手机操作系统,使 AI 不再是孤立的功能模块,而是具备跨应用调度与任务执行能力的系统级智能助手。
但雷科技注意到,相较往年,本届 WAIC 的焦点已悄然转移:
在智元机器人展台,GO-2 具身基座模型正驱动实体机器人完成流水线上的上下料与装箱作业;魔法原子展出的 Magic-VLA K02,则在现场演示叠盒封胶、衣物整理等精细化操作;甚至整个 WAIC 展馆的导览服务,均由超 60 台智元机器人协同承担……大模型正加速挣脱虚拟界面的束缚,迈入真实物理空间,向“物理 AI”时代全面进发。

图片来源:乐聚机器人
回溯来看,2023 年大模型刚爆发时,行业比拼的是参数规模与多模态支持广度;到了 2025 年,竞争重心转向上下文窗口长度与复杂推理能力。而短短一年间,曾经仅活跃于 App 内与 API 接口中的大模型,已跳出对话框,主动介入现实生产与生活场景;其称谓也从“大模型底座”,悄然演变为更具行动指向性的“基座模型”。
在雷科技看来,这场由“数字世界”向“现实世界”的跃迁,正是 WAIC 2026 最具标志性的变革所在。
参数不再是衡量 AI 实力的唯一标尺
从虚拟走向现实,最先被重塑的,是我们评估大模型价值的逻辑。
举例而言,以往某款新模型发布,公众关注点往往集中于参数量、上下文容量及各类基准测试排名;面壁智能在 WAIC 展示 MiniCPM 时,也着重强调其在同等尺寸模型中的综合性能优势。
然而对普通用户而言,参数本身难以转化为可感知的实际体验。 用户不会因模型上下文更长,就改变订票、查天气或制作表格的习惯;一部手机即便预装了数十种 AI 功能,若仍需手动在地图、支付、聊天、文档和浏览器之间反复切换,它依然只是“搭载 AI 应用的普通手机”,而非真正意义上的“AI 原生设备”。
此时,AI Agent 的理念应运而生——用户只需表达意图,模型即可理解需求,并自主调用对应服务完成端到端任务。本届 WAIC 上亮相的“智能体手机”,正是这一理念的具象化呈现:
阶跃星辰将个人智能体 Amoo 深度嵌入 STEPX Neo 手机系统底层;豆包与努比亚持续推进 GUI Agent 技术,让模型通过屏幕理解与模拟点击实现跨 App 协同……而在手机之外,全行业迈向 Agent 化的趋势更为显著。

图片来源:阶跃星辰
以曾被归类为 AIoT 的硬件为例,过去不少所谓“AI 设备”,实质仍是定制 Android 系统的手机,如 Rabbit R1。但据雷科技今年实地体验,新一代 AI 硬件已普遍具备初步的 Agent 能力。
具身智能,正是 AI 在物理世界的“行动型 Agent”
或许有人会问:为何在具身智能兴起之际重提 AI Agent?二者关系其实一目了然:
若按大模型能力演进路径划分,第一阶段聚焦内容理解与生成,第二阶段迈向任务驱动与自主决策(即 Agent),而第三阶段,正是具身智能与世界模型所承载的“与物理世界交互并建模”的能力。
进入具身智能时代,基座模型不仅要听懂指令,还需具备对现实环境的感知、理解与闭环响应能力,例如视觉-语言-动作联合模型(VLA)。值得欣喜的是,WAIC 2026 已清晰展现出具身智能与世界模型的规模化落地雏形:
智元、魔法原子、乐聚等企业集中展示了具身机器人在工业产线中的实际应用;启元更进一步,在展会现场直接启用机器人承担全流程导览任务。诚然,这些“流水线作业”不如机器人跳舞、打拳那般吸睛,但从产业视角看,恰恰是这类看似枯燥、却高度标准化的任务,最能体现具身智能与世界模型的真实价值。

图片来源:乐聚机器人
事实上,这种“务实”的落地节奏,也契合当前具身智能的发展阶段:相较于家庭场景的开放性与不确定性,工厂任务具有流程固定、动作可拆解、结果可量化等天然优势。
字节跳动正式推出了其最新的智能图像创作模型——Seedream 5.0 Lite。作为豆包大模型2.0系列的重要组成部分,该模型不仅在理解、推理和生成能力上实现了全面跃升,更针对企业级视觉创作需求进行了深度优化,标志着AI生图技术向“实用化”与“智能化”迈出了关键一步。
尤为关键的是,此类场景为大模型提供了高质量、高密度的真实世界数据闭环: 机器人率先在规则明确的环境中运行,企业基于实际表现发现问题、积累数据,再反哺模型迭代训练,最终将能力逐步拓展至更复杂、更动态的现实任务中。

图片来源:雷科技
正因如此,本届 WAIC 上,主流大模型厂商不约而同将具身智能与世界模型列为战略重心,并公开宣布相关产品即将以千万台级规模量产交付。 在雷科技看来,“破屏而出、扎根现实”,已成为 2026 年中国 AI 产业的集体共识。
迈向物理世界,大模型亟需能力升级
当然,具身智能要真正融入现实,也倒逼大模型自身能力体系迎来新一轮升级。
以响应时效为例:在聊天、图像生成等传统场景中,用户容忍几秒延迟并无明显影响;但在具身智能主导的物理交互场景中,每一毫秒的滞后都可能引发连锁风险:
在工厂产线上,微小延迟可能放大为整条产线节拍紊乱,直接影响良率与产能;在智能驾驶场景下,响应速度更直接关乎驾乘者生命安全。
因此,本届 WAIC 上,越来越多模型厂商重新聚焦“端侧智能”,依托本地化部署优势,大幅压缩具身智能系统的端到端响应时延。
以“新 AI 六小虎”中唯一专注端侧智能的大模型公司——面壁智能为例,早在 2024 年,其 MiniCPM 系列便验证了轻量级端侧模型亦可承载高阶智能。区别于多数厂商从云端大模型蒸馏出的简化版端侧模型,面壁智能的端侧模型基于原生端侧 AGI 架构独立研发,非云端模型的裁剪副本,而是专为边缘计算场景深度优化的原生智能体。

图片来源:雷科技
这一原生特性,使其端侧模型无需联网即可实现毫秒级响应与实时推理。当同行仍在探索如何降低模型延迟以适配物理世界时,面壁智能已率先实现端侧智能体在汽车前装市场的规模化量产交付。
不过,正如那个经典的“心算 vs 笔算”比喻所示,除了响应速度,一个真正能在现实中可靠运行的模型,还必须学会感知并适应环境的动态变化。
这正是世界模型与 VLA 成为具身智能核心方向的根本原因——它们将感知、理解、推理与执行能力有机融合为一体。
当用户下达“把箱子搬到货架上”的指令,模型需先解析语义,再通过摄像头识别箱子与货架的空间位置,最后精准控制机械臂完成抓取、搬运与放置。全过程依赖语言模型、视觉模型与运动控制系统无缝协同,任一环节出现“断连”,都将导致任务失败。
这种环环相扣的协同范式,也让“全栈模型”成为大模型走向物理世界的关键路径: VLA 担纲多模态对齐与动作映射,世界模型负责因果推演与结果预测,端侧模型保障本地实时响应。而地瓜机器人在 WAIC 展出的旭日 S600 芯片,正是“全栈智能”理念在硬件层面的标杆实践。
WAIC 2026:大模型从实验室走向产业化的关键拐点?
从算法模型、智能终端到实体机器人,走完本届 WAIC 全程后,小雷深切感受到:行业竞争的主轴正在迁移。
参数规模、上下文长度与推理深度固然定义着模型的能力上限,但决定其能否真正“可用、好用、敢用”的,是端侧部署能力、世界建模能力与全栈整合能力——而这三者,恰恰是具身智能时代客户最核心的选型依据。
由此观之,本届 WAIC 主题转向,实属水到渠成:大模型厂商聚焦端侧落地与世界模型构建,机器人企业加速技术商业化验证,芯片厂商同步调整产品路线图,围绕机器人场景重构生态……过去各自为战的技术路径,已在具身智能浪潮中深度融合。

图片来源:雷科技
可以确信,中国 AI 产业已整体迈入全新发展阶段。
雷科技认为,此阶段的大模型,正告别仅服务于消费级应用的“学习期”,加速进入工业、制造、交通等严肃垂直领域的“实战期”。 面对更高效率、更强稳定性与更严安全性要求,谁能率先完成从“技术能力”到“产业能力”的跨越,谁就有望成为新赛道的规则制定者,在下一阶段全球 AI 竞争中掌握战略主动权。
而 WAIC 2026 上各企业的扎实布局与落地成果,已然表明:中国 AI 产业,准备好了。
本文来自“雷科技”,36氪经授权发布。










