2026年7月27日,全球ai智能体权威评测基准osworld正式发布最新榜单,实在智能自主研发的实在agent以90.2%的任务成功率,强势登顶总榜及agentic framework细分榜单双冠军。这也是osworld自2024年面世以来,首个突破90%大关的computer-use类智能体。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

01 OSWorld为何成为行业“硬通货”
OSWorld由香港大学、卡内基梅隆大学(CMU)与滑铁卢大学联合于2024年在人工智能顶级会议NeurIPS上首次提出,现已成为计算机操作型智能体领域最具公信力的评测基准之一。其核心设计理念极为清晰:不测“解题能力”,只验“干活能力”。
区别于仅支持网页交互或API调用的传统评测体系,OSWorld直接在真实Ubuntu虚拟机环境中部署Chromium、LibreOffice、GIMP、VS Code等原生桌面应用,构建了361项贴近真实工作流的实战任务,覆盖办公协同、代码开发、UI设计、系统运维四大高频场景。所有任务均配备自动化验证脚本,结果由机器严格判定,彻底规避人工评分带来的主观偏差。
主流厂商在发布新一代旗舰模型时,普遍将OSWorld成绩作为关键性能指标:OpenAI推出GPT-5.4时强调“首次全面超越人类水平”,Google发布Gemini 3.6 Flash时标注“83%为当前全场最高分”,Anthropic上线Claude Sonnet 5时重点突出“81.2%达成新高”。
回溯该基准的历史成绩曲线:2024年初最强模型仅达12.2%;2025年逐步跃升至22.0%,继而突破至72.6%——首次超过人类实操基线(72.36%);2026年5月攀升至83.6%;短短两个月后,纪录被刷新为90.2%。从12%到83%,是基础功能完备性的跨越;而从83%迈向90%,则是对工程鲁棒性与系统稳定性的极限锤炼——两个阶段所直面的技术瓶颈,本质迥异。

02 解析90.2%:决胜于三大高难场景
361项任务总得分为325.59分,换算成功率为90.2%。细究得分构成,日常办公类任务(如Calc 46/47、Writer 22/23、VS Code 22/23、Impress 42.96/47等)构成了坚实的能力底座,但真正拉开技术代差的,是以下三个公认最难攻克的场景:
跨应用协同(78.81/93)。 这93个任务高度还原企业真实工作流:Chrome下载报表→LibreOffice清洗数据→GIMP截图标注→Thunderbird发送带附件邮件。整个流程需在4–5款独立桌面软件间无缝切换,任一环节状态丢失即导致整条链路中断。
GIMP图像处理(24/26,准确率92.3%)。 GIMP以其浮动式面板、非标准化工具栏与像素级精细操作闻名,长期被视为视觉理解模型的“试金石”。传统方案在此类非规范UI界面上频繁出现定位漂移与操作错位。26道题拿下24道,印证其对复杂界面元素的识别精度与动作控制已达成熟水准。
系统底层操作(24/24,满分通关)。 涉及进程监控、权限变更、Shell命令执行等零容错任务——任何一步偏差都将引发不可逆失败。24题全对,表明其底层执行闭环已具备可验证的确定性保障能力。
三项能力并非孤立存在,而是相互支撑、协同生效,共同构筑起实在Agent的全栈式工程可靠性。

03 登顶逻辑:Agentic Framework路径为何胜出
90.2%的背后,是一次关键的技术路线选择。
OSWorld设三大参赛赛道:专用模型、通用大模型、智能体框架。实在Agent提交的是Agentic Framework方案——不依赖定制化模型训练,而是通过工程化架构驱动通用模型协同作业。一个显著的产业趋势正浮现:TOP10榜单中已有6支团队采用框架路线,且平均得分明显高于纯模型方案。
这印证了一个正在加速凝聚的行业共识:Agent = Model + Harness。模型是“大脑”,决定认知上限;Harness则是包裹模型的完整工程体系——涵盖任务分解、工具编排、状态追踪、异常恢复、安全校验等模块——决定能否真正落地。
实证研究显示,斯坦福、清华等机构发现:在同一模型基础上,仅优化Harness设计,复杂任务完成率即可提升6–17个百分点。Pi Research的对照实验更直观:仅调整传入模型的工具描述格式,代码生成任务成功率便从6.7%飙升至68.3%,增幅近10倍。Anthropic在其工程博客中明确指出:“评估一个智能体,本质上是在评估harness与model协同工作的整体效能。”
从OSWorld实战表现反推,实在Agent在打榜方案中形成了三大工程优势:
- 长链路状态持久化能力。 跨应用协同93题斩获78.81分,在多跳、跨软件流程中持续维持上下文一致性,杜绝中途“失忆”。
- 非标准UI视觉泛化能力。 GIMP图像处理26题拿下24题(92.3%),在浮动面板密集、布局动态变化的视觉场景中保持高精度操作。
- 底层操作闭环验证能力。 系统级任务24题全满,对进程管理、权限修改、命令行执行实现零误差、可复现的确定性执行。
三者叠加,构成实在Agent领跑榜单的底层工程基石。
04 从榜单到产线:工程能力如何驱动规模化落地
榜单验证的是技术路径与工程架构的理论天花板,产品则考验整套体系的工业化交付能力。
实在智能自2018年起深耕企业级自动化赛道,八年服务超6000家客户,其中90%为世界500强、中央及地方国企、A股与港股上市龙头企业。正是源于在真实桌面自动化场景中的长期沉淀,实在智能对操作系统交互逻辑、异常触发边界、合规审计要求形成了系统性工程认知——这些一线经验,持续反哺Harness体系的迭代升级,也成为其首次参榜即登顶SOTA的深层动因。

在产品化层面,这套工程能力具象表现为三大核心特性:
“API优先、GUI兜底”的混合执行范式。 不绑定单一交互通道:API可用时优先调用,保障效率;API失效时自动切换至像素级GUI操作,模拟人类视觉与操作逻辑。此举大幅降低传统RPA“接口一改即瘫”的脆弱性,亦是支撑跨应用、跨系统长流程任务的关键前提。
全链路操作可追溯与安全治理机制。 自动记录操作行为、决策依据、异常响应三大维度,每步操作附带时间戳与实时截屏,支持全栈私有化部署。对金融、能源、政务等强监管行业而言,这是实现“技术可用”向“合规可用”跃迁的刚性门槛。
多模型弹性接入与智能路由能力。 实在Agent内置DeepSeek、豆包、千问、Kimi等主流大模型接口,支持端侧轻量模型与云端多模态模型(VLM)混合调度。模型可按需替换,底层工程框架保持不变,企业无需因模型升级而重构整套自动化体系。
从90%到工业级99.99%,表面相差仅9.99个百分点,实质却是从“能干”到“敢托付”的信任质变。实在Agent已在自主执行基础上集成人机协同机制与安全断路器:对高风险操作、敏感数据访问自动触发提权确认,支持操作撤销与状态回滚。这本质上是将人类判断力嵌入系统最末端,成为效率与安全之间的动态平衡阀。
实在Agent此次登顶最值得深思之处在于:它所证明的,并非“中国又诞生一款高分模型”,而是“一套深度扎根真实场景的工程方法论,能在不依赖专用模型的前提下,将Computer-Use智能体推向全球第一”。当行业仍在争论模型参数应堆至何种规模时,这条技术路径已然给出另一重答案——把模型视作可插拔组件,把工程打造成可复用基座。90.2%不是终点,但它确实让“智能体走进真实产线”这件事,变得前所未有地触手可及。











