当智能手机硬件创新步入瓶颈阶段,gui 智能体正迅速崛起为各大手机厂商竞相布局的关键战场。从早期仅支持语音唤醒的简单助手,进化为具备自主任务规划、视觉环境理解、跨应用全流程操作能力的智能代理,端侧 ai 的实际落地水平,已悄然成为衡量产品差异化竞争力的核心标尺。近期,superclue 正式发布 agentclue-mobile 6 月手机助手 gui 智能体评测榜单,覆盖当前主流的 6 款原生智能体系统,在统一测试框架下展开横向比拼,最终结果呈现出“一骑绝尘、三强缠斗、双弱追赶”的鲜明梯队格局。测评数据清晰揭示行业现状:参数规模并非性能决定性因素,模型结构设计、任务场景匹配度、单步动作决策精度,才是真正推动 ai 手机走向规模化商用的底层引擎。
一、榜单全景:三大阵营界限分明,中兴实现跨越式领跑
本次评测严格筛选具备完整智能体架构与独立训练模型的 6 款终端级产品,全部基于 ADB 设备控制 + 纯视觉输入的标准环境执行测试,围绕意图识别、界面感知、长链路执行三大核心能力维度进行量化评估,最终综合得分排名如下:


依据总分与多维能力表现,6 款产品被明确划分为三个层级,实力断层显著:
1. 领先梯队(90 分以上,接近商用标准):仅中兴 GUI 手机智能体成功入围。以 91.29 分高居榜首,是全场唯一在稳定性、鲁棒性与实用性上全面逼近商业化交付门槛的产品。其在简单、中等、困难三级任务中均保持高水准输出,七大细分指标全部突破 85 分,端到端任务完成率达 93%,基本克服了当前端侧智能体普遍存在的“语义误读、操作冗余、流程中断”等典型缺陷。
2. 追赶梯队(65–75 分,初步可用):智谱 AI Open-AutoGLM、阿里系两款产品构成中游主力,三者分差控制在 8 分以内,呈现高度胶着态势。该阵营已具备基础意图解析与界面识别能力,但在跨 App 协同执行环节普遍存在明显短板,任务完成率集中于 56%–60%,距离真正面向大众用户的规模化部署仍有不小距离。
3. 探索梯队(60 分以下,原型验证阶段):阶跃星辰 GELab-Zero、字节跳动 UI-TARS 处于技术攻坚初期。其中 UI-TARS 以 30.19 分垫底,与榜首分差高达 61 分以上,凸显纯视觉轻量模型在复杂移动交互场景下的根本性局限;GELab-Zero 虽略优于 UI-TARS,但整体能力薄弱,所有子项得分均未达 62 分,任务完成率仅为 35%。
从部署方式观察,采用云端 API 调用的产品整体表现优于本地化部署方案。榜单前四名中有三款依赖云侧推理,而四款本地运行产品则包揽后三位。这一现象印证了现阶段行业共识:受限于终端算力、内存容量及功耗约束,纯端侧小模型尚难支撑高复杂度 GUI 自动化任务,“端云协同”仍是兼顾性能与体验的最优路径。
二、五大关键洞察深度解读:大模型必须上云?未必,但必须适配!
本场测评不止于分数排序,更通过难度分级、步骤回溯、多维拆解等方式,精准定位 GUI 智能体的技术瓶颈与发展脉络,五大核心发现共同勾勒出当前赛道的真实图景。
1. 难度响应失衡:“中等任务”反成最大拦路虎,部分产品出现能力倒挂

题目难度采用倒金字塔结构设计,困难题占比最高,重点考察智能体的多意图处理、异常恢复与长程一致性。各产品在不同难度层级的表现,打破了“越难越低分”的惯性认知:
中兴全难度稳健输出:简单任务得分 96.99 分,困难任务仍稳定在 85 分以上,短指令响应迅捷、长流程执行可靠,展现出极强的任务泛化能力。
第二梯队出现显著“难度倒置”:Open-AutoGLM 困难题得分 76.71 分,中等题仅 68.68 分;Mobile-Agent-3.5 困难题 73.09 分,中等题跌至 58.17 分。究其原因,中等任务常隐含多重目标、模糊边界与上下文依赖,对模型的逻辑连贯性与状态追踪能力提出更高要求,反而比结构清晰的困难任务更具挑战性。
第三梯队全线承压:MAI-UI、GELab-Zero 基本符合“难度越高、得分越低”的线性规律,但绝对值偏低;UI-TARS 更为极端,三类难度得分均徘徊在 30 分附近,属于典型的“全场景失效”,无法支撑任何有效自动化交互。
2. 执行效能:完成率与操作步数强相关,冗余点击严重损害体验
测评同步采集任务完成率与平均操作步数两项关键指标,直指影响用户真实使用感受的核心痛点:

中兴:完成率高达 93%,单题平均操作仅 10.83 步。每一步动作精准匹配用户意图,极少出现无效点击或反复回退,效率与准确性兼具,完全契合日常高频使用需求。
第二梯队:完成率维持在 56%–60%,但步数差异悬殊。Mobile-Agent-3.5(59%/12.15 步)节奏相对合理;MAI-UI 完成率 56%,平均步数却飙升至 17.23 步,大量无效交互拉低整体体验,呈现“动作繁多、成功率低”的典型症结。
第三梯队陷入负向循环:GELab-Zero 完成率 35%,平均步数 16.75 步;UI-TARS 完成率仅 18%,平均步数高达 20.62 步——相当于每执行约 11 步才成功一次,实用性几近归零。
行业共识由此强化:智能体能否实用,不仅取决于“能不能做完”,更取决于“用多少步做完”。减少冗余操作、提升单步决策质量,比单纯堆高整体准确率更能切实改善用户体验。
3. 架构优先于参数:云端大模型优势明显,本地小模型“堆料无效”
模型设计思路与场景适配能力,远比参数数量更具决定性:

中兴 Nebula-Pilot V1.0(27B)大幅领先,相较第二名 Open-AutoGLM(9B)拉开 18 分差距,充分验证大模型在复杂推理、长程规划方面的结构性优势。
7B 模型反不如 4B:字节 UI-TARS(7B)得分仅 30.19 分,显著落后于阶跃星辰 GELab-Zero(4B,54.26 分)。说明脱离 GUI 场景定制的盲目扩参毫无价值,针对移动端交互深度优化的小模型,完全可超越通用型更大参数模型。
4B–9B 区间边际收益递减:该参数范围内,模型升级带来的能力提升趋于平缓,靠“堆参数”换取竞争力的路径已然失效。
4. 共性短板暴露:跨应用协同执行成行业天花板,决定智能体上限
测评细分为七大能力模块,热力图直观呈现各产品能力分布,也暴露出全行业的统一瓶颈:

中兴:六大主干能力(简单 / 中等 / 困难任务、意图拆解、GUI 感知、跨应用执行)全部突破 85 分,无明显短板,为其高完成率提供坚实支撑。
第二梯队:认知与感知能力尚可,但跨应用执行集体掉队。Open-AutoGLM、Mobile-Agent-3.5 在该维度得分分别为 65.69 分、67.10 分,面对多 App 切换、数据传递、通知联动等现实场景时明显乏力;MAI-UI 表现分化,意图拆解达 76.72 分,跨应用执行却仅有 50.79 分,“想得清、做不到”的矛盾尤为突出。
第三梯队:全面落后。GELab-Zero 各维度均低于 62 分;UI-TARS 仅 GUI 感知一项达 46.06 分,其余全部低于 31 分,纯视觉架构难以贯通“理解—规划—执行”闭环。
结论明确:端到端任务成功率由最薄弱环节决定。当前多数产品卡在“跨应用执行”这一关,这正是 GUI 智能体从“概念玩具”迈向“生产力工具”的必经门槛。
5. 实战对比:高频复合任务还原真实场景,差距肉眼可见
本次评测选取典型多意图+跨应用任务作为标杆案例:“在高德地图搜索海底捞并导航至最近门店,随后打开微信,在‘产品交流群’中发送实时位置共享”,完整模拟用户真实操作流,两款代表梯队产品的执行效果形成强烈反差。

1. 中兴 GUI 手机智能体(满分 100 分)
全程 15 步,步步精准、环环相扣:依次启动高德、输入关键词、按距离排序、选定最近门店、发起导航、返回桌面、启动微信、进入指定群聊、开启实时位置共享。无冗余动作、无误触行为,准确识别“最近门店”“实时位置共享”两大关键语义,完全贴合用户原始诉求。裁判判定全部步骤有效,是全场唯一达成满分交付的智能体。
2. GELab-Zero(得分 53.85 分)
共执行 13 步,出现两处致命偏差:其一,在高德搜索结果中未按距离优先选择最近门店,违背“导航至最近一家”核心指令;其二,混淆微信“发送静态位置”与“共享实时位置”功能,错误调用前者,导致位置共享失败。两大关键失误使整条操作链失去意义,大量步骤沦为无效劳动——这也是中低端智能体的共性缺陷:指令理解停留表层,无法分辨功能差异与隐含约束。
该案例直观诠释分数背后的真实体验落差:顶尖 GUI 智能体能像人类一样深度理解自然语言、辨析细微语义;而落后产品仅能完成机械点击,一旦涉及多目标、隐性规则,即刻崩溃。
三、结语:GUI 智能体,正在重写下一代手机的价值定义
智能手机硬件创新已触及物理极限,影像模组、SoC 性能、充电速率的同质化内卷,难以再激发用户换机热情。而具备主动服务能力的 GUI 智能体,正成为破局增长困局的关键变量。
AgentCLUE-Mobile 本次评测交出一份冷静而务实的成绩单:国内手机智能体发展格局初步固化——中兴依托自研 27B 大模型与极致场景打磨,率先迈入商用临界点;智谱、阿里等头部玩家处于能力爬坡期,亟需突破长链路协同瓶颈;纯视觉轻量路线则遭遇现实壁垒。
对整个产业而言,这场测评释放明确信号:AI 手机的竞争焦点,早已告别“有没有大模型”的口号之争,转向“模型能不能用、用得是否顺手”的实战较量。参数只是纸面数字,模型架构合理性、场景适配深度、工程实现精度、交互细节打磨,才是塑造终极用户体验的真正支点。
站在技术拐点之上,AI 手机的真正大战,才刚刚拉开帷幕。短期内,“端云协同”仍将主导市场,率先实现稳定商用的产品将赢得先发优势;长期看,随着端侧算力持续跃升、模型压缩与推理技术加速演进,本地化部署的高性能轻量智能体,或将成长为最终形态。











