马斯克旗下的人工智能公司 spacexai 近日推出了全新一代先进模型 grok 4.6,聚焦于长周期运行的智能体、代码开发及知识密集型任务场景,并推出更具性价比的计费方案,显著优化此类高负载应用的运营成本。

Grok
根据第三方评测机构 Artificial Analysis 发布的智能指数榜单,Grok 4.6 获得 61 分,成功超越月之暗面开源模型 Kimi K3,与 OpenAI 的 GPT-5.6 Sol Max 并驾齐驱;相较前代 Grok 4.5 提升 5 分。当前全球排名前两位仍由 Anthropic 的 Claude Opus 5 和 Claude Fable 5 占据,Grok 4.6 与 GPT-5.6 Sol Max 共同位列世界第三。
编程能力与智能体表现成为本次升级的核心亮点。在 DeepSWE v1.1 基准测试中,其得分由 54% 显著提升至 65.9%;APEX-Agents 智能体基准测试成绩从 47.1% 上升至 57.5%,增幅达 10.4 个百分点,小幅领先 GPT-5.6 Sol Max 的 56.7%;Terminal-Bench v3.0 得分亦由 15.7% 提升至 26%。但在后两项指标上,Claude Fable 5 Max 仍保持优势,表明 Grok 4.6 虽取得实质性突破,但尚未全面超越头部竞品。
价格策略方面,Grok 4.6 的 API 初始报价为每百万输入 token 2 美元、每百万输出 token 6 美元,处于当前前沿模型价格区间的中位水平,约为 GPT-5.6 Sol 标准版定价的一半。该模型支持最高 50 万 token 的上下文长度——当提示词长度低于 20 万 token 时,适用上述基础费率;超过该阈值后,费用将相应上调。据 SpaceXAI 官方消息,Grok 4.6 已于今日正式上线 Grok Build 平台,并同步集成至其收购的 AI 编程工具 Cursor,同时接入 OpenRouter、Vercel 和 Cloudflare 等生态合作伙伴。
训练层面,SpaceXAI 指出,相比 Grok 4.5,Grok 4.6 经历了更充分的训练周期,并在通用编程、知识工作流、内核级优化、网页工程及计算机辅助设计(CAD)等典型智能体环境中,强化了基于反馈的深度强化学习机制。实测显示,Grok 4.6 在长序列任务中展现出更强的自主验证与迭代调试能力。就执行效率而言,Artificial Analysis 数据表明:完成 AA-Briefcase 类典型工作负载时,Grok 4.6 平均仅需约 53 轮交互与 5 亿输入 token;而 Claude Opus 5 Max 则需约 103 轮交互与 20 亿输入 token,前者在资源利用率与响应速度上的优势极为突出。









