必须在统一硬件、相同任务链路和真实agent工作负载下测端到端响应时长与吞吐稳定性,禁用云端回退、冷启动测试、取中间48轮均值;step 3.7 flash最快(217ms),deepseek-v4最慢(492ms)。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要对比不同 Agent Space 模型的实际运行速度,不能只看官网标称的 tokens/s 数值,必须在统一硬件、相同任务链路和真实 Agent 工作负载下测端到端响应时长与吞吐稳定性。
测速前必须统一基准环境
第一步:使用 Acrab Agent Box 或 GΞLIX 1 芯片参考平台,禁用云端回退与模型卸载机制→确保所有推理全程在端侧完成。
第二步:加载标准 Agent 任务套件,至少包含三项典型链路:① 邮件+日程+文件三源检索并生成周计划;② 视频剪辑智能体(同步处理字幕文本+语音转写+关键帧描述);③ Coding Agent(读取 GitHub PR 描述→定位 diff→生成修复补丁→插入单元测试)。
第三步:关闭所有缓存预热,每次测试从冷启动开始,连续执行 50 轮,丢弃首轮与末轮数据,取中间 48 轮的平均端到端响应时长(End-to-End Response Time)作为最终指标。
【不统一硬件或跳过冷启动,测出的速度值会虚高30%以上,完全不可比】
主流模型实测速度排序(2026年8月Acrab实验室公开数据)
按端侧 Agent 典型任务平均响应时长升序排列(数值越小越快):
• Step 3.7 Flash:217ms(409 tokens/s,首 token 延迟 42ms)
• Gemini 3.5 Flash:248ms(289 tokens/s,首 token 延迟 65ms)
• Dream 7B(dLLM):283ms(全局生成模式,首 token 延迟 112ms,但任务完成总延迟更低)
• Qwen 3.7-Max:356ms(GPU 优化后较上代提速10倍,但端侧内存带宽受限)
• DeepSeek-V4:492ms(自回归范式在端侧芯片并行利用率不足35%)
方法一:用 MCP Atlas 基准快速横向比对
直接运行官方发布的 MCP Atlas v2.3 测试包,在同一台 AI PC 上执行全部 12 个 Agent 子任务。
重点看两项结果:① “Planning Latency”(规划阶段耗时),dLLM 类模型普遍比自回归模型低 41%~57%;② “Tool Call Throughput”(每秒成功调用外部工具次数),Step 3.7 Flash 达到 8.7 次/秒,Dream 7B 为 7.2 次/秒。
注意:MCP Atlas 不测首 token 延迟,只反映整条任务链路的稳定吞吐能力。
方法二:抓取真实 token 级生成节奏
启用模型输出流监控工具(如 Acrab TraceView),记录单次任务中每个 token 的产出时间戳。
自回归模型(如 DeepSeek-V4、Qwen 3.7-Max)会呈现严格线性间隔,例如每 18ms 出一个 token;而 dLLM 模型(如 Dream 7B)会出现“脉冲式输出”——前 300ms 无输出,随后 200ms 内密集刷出 120 个 token,再停顿 80ms 进行全局校验。
这种节奏差异导致传统 speed test 工具误判 dLLM 为“卡顿”,实际任务完成更快。











