一个月9款旗舰,大模型进入“月抛”时代?

秋瑶同学_7009

秋瑶同学_7009

2026-08-06

1038人浏览

原创

一个月内,9款旗舰级大模型密集登场,这在大模型领域实属罕见。

从月初腾讯混元Hy3正式发布并开源,到月末Anthropic推出Claude Opus 5,中间Kimi K3、Qwen3.8-Max预览版、Grok 4.5等模型接连亮相。7月由此成为近一年来少有的模型发布高峰。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

一个月9款旗舰,大模型进入“月抛”时代?

各家厂商的发布时间并不统一:有的趁竞品更新后的空档快速跟进;有的选在世界人工智能大会(WAIC)前后集中发布;也有的通过价格策略调整,主动应对市场竞争。

但7月的意义不仅在于发布数量多,更关键的是——这一轮密集上新折射出两大深层趋势。

第一,头部模型的能力鸿沟正在加速收窄。根据Artificial Analysis最新发布的综合智能指数,主流模型之间的得分差距显著缩小。随着迭代节奏加快,“最强模型”的王座愈发难以长期稳坐,厂商正转向差异化突围,在特定任务中建立优势,而非执着于单一维度的绝对领先。

第二,开源模型已正式跻身第一梯队。本次7月发布的新模型中,腾讯混元Hy3、Kimi K3等均选择开放权重(即公开模型参数,支持开发者本地下载与部署)。尤为突出的是,Kimi K3在Code Arena前端编程榜单中拔得头筹,力压GPT-5.6 Sol与Claude Fable 5。过去两年,开源模型常被视作闭源模型的“追赶者”;而本轮竞争表明,其已在部分开发场景中具备与闭源旗舰同台竞技的实力。

那么,这场集中爆发究竟带来了哪些实质性变化?又预示着怎样的行业走向?

01. 竞争逻辑正在重构:不再唯“智商”论英雄

过去几年,大模型比拼的核心是通用能力——谁知识更广、回答更准、逻辑更严密。如今,战场早已悄然转移。

本轮最鲜明的争夺焦点,落在了代码能力上。

OpenAI持续加码编程与复杂推理能力,并不断拓展Codex生态,意图以开发工具链深度绑定程序员群体;Anthropic则聚焦代码理解与安全审计能力,瞄准大型工程项目的系统性风险识别;Grok 4.5主打响应速度与成本优势,深度集成AI编程工具Cursor,覆盖高频、轻量的日常开发需求。

大模型研究者姚宇航向「定焦One」指出:“几乎所有头部厂商都在编程方向重兵投入,能力差距正被迅速抹平。比如Kimi K3的代码生成质量提升显著,已逼近一线闭源模型水准。”

一个月9款旗舰,大模型进入“月抛”时代?

图源 / pexels

Ask Gemini/ChatGPT
Ask Gemini/ChatGPT

用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。

下载

Agent(智能体)则是另一条核心战线。GPT-5.6 Sol依托Codex探索自动化编程闭环;Opus 5强调长周期任务的连贯执行能力;Kimi K3演示了多步连续任务调度与完成;腾讯混元Hy3则尝试结合微信生态,落地轻量级智能体应用。

不过,当前智能体仍处于“能跑通”但“难实用”阶段。独立开发者北城坦言,现有产品短板不在调用工具的能力,而在任务拆解与资源调度逻辑。“比如Codex的Ultra模式会启动大量子代理,多个子代理反复读取同一文件、重复分析同类内容,导致Token激增,但有效产出并未同步提升。”在他看来,智能体进化的关键并非堆叠子代理数量,而是构建“该不该分析、哪里可跳过”的判断机制。

姚宇航持相似观点:智能体无疑是当前最具潜力的方向,但距离真正成熟仍有明显距离。他特别指出,医疗、金融等垂直领域的智能体落地空间更大;下一阶段的竞争胜负手,将不只是模型本身有多强,更取决于它在真实业务场景中是否好用、客户是否愿意为其实效付费。

国产模型则另辟蹊径,通过强化细分能力破局。Kimi K3重点突破长上下文理解、前端编程及产品设计能力,在多项编程评测中稳居前列,整体表现已接近国际闭源旗舰水平。

参数规模与推理效率的博弈,亦成新主线。

7月亮相的多款模型参数量迈入万亿乃至数万亿级别,但“参数大≠能力强”已成共识。得益于MoE(Mixture of Experts)架构普及,模型可在保持海量参数的同时,仅激活其中一小部分参与推理,大幅降低实际算力开销。

由此,行业自然分化出两条路径:
一是继续扩大参数规模,以“更大”换取“更强”;
二是聚焦推理效率,用更小的激活参数实现媲美旗舰的性能表现。

价格,也成为本轮竞争中最直观的变量。

海外厂商普遍采用分层定价策略。OpenAI进一步细化GPT-5.6产品线,按任务复杂度划分版本,引导用户精准匹配模型;Anthropic坚持高性能旗舰路线,以Opus系列锚定高价值企业与开发者市场;Grok 4.5则走极致性价比路线,单次输出价格仅为Opus系列的1/4,并借与Cursor深度整合吸引中小开发者。

国内厂商则更强调成本优势。过去半年,多家国产模型厂商持续下调API报价,旨在以低门槛打开开发者与中小企业市场,加速生态渗透。

一句话概括:7月的大模型竞争,已从单维“智力竞赛”,全面升级为涵盖代码能力、智能体落地、参数效率与商业定价的多维竞合。

02. 谁惊艳全场?谁争议不断?谁尚待验证?

综合对比前代升级幅度、权威榜单排名及一线开发者反馈,7月发布的新模型大致可分为三类。

首先,明显超出预期的代表:Kimi K3、Grok 4.5、混元Hy3。

最受瞩目的当属Kimi K3。该模型采用MoE架构,总参数达万亿级,重点强化长上下文处理、前端编程与产品设计能力。上线当日即以1679分登顶Code Arena前端编程榜榜首,相较前代Kimi K2.6(第18名)跃升17位;一周后,在Arena综合榜中首次闯入全球Top 10。

但Kimi K3亦有清晰的能力边界。Artificial Analysis知识可靠性测试显示,其幻觉率从前代39%升至51%,输出速度约33 Token/s,显著低于同类竞品。

开发者实测印证了这种“偏科”特性。北城评价称:“Kimi K3相比上一代确有质变,尤其在前端开发、UI设计和产品表达上优势突出。例如优化网站界面、设计APP原型,它给出的方案往往更贴近真实需求;但在涉及底层架构或跨模块协同的复杂工程任务中,稳定性仍显不足。”

一个月9款旗舰,大模型进入“月抛”时代?

图源 / pexels

同样引发广泛关注的是Grok 4.5。7月9日发布后,它迅速跻身Artificial Analysis智能指数前列,并在多项工具调用测试中表现亮眼,被不少开发者视为“高性价比之选”。

北城的体验与此一致:“Grok 4.5最大优势是快——同样一个需求,用它可能3–5分钟搞定,GPT-5.6有时要耗时20分钟甚至半小时。加上价格更低,特别适合需要快速交付的场景。”姚宇航补充道,Grok 4.5的编程能力经过专项优化,配合Cursor使用体验流畅。值得注意的是,SpaceX已于近期宣布收购Cursor母公司Anysphere,交易预计三季度完成;xAI与Cursor的数据合作,也被认为直接助推了Grok 4.5在编程场景的体验升级。

混元Hy3则代表了“效率派”的突破。该模型总参数295B,但激活参数仅21B,以不到旗舰模型五分之一的活跃计算量,在多个公开基准测试中成绩逼近更大体量竞品。不过在SWE-Bench Pro(代码修复能力评测)中,混元Hy3得分为57.9,仍落后于Claude Opus 4.8的69.2分,说明其在复杂工程问题上的修复能力尚需补强。

姚宇航评价:“混元Hy3相比腾讯此前模型确有进步,加之开源+轻量化设计,对中等规模团队而言是个务实的选择。”

其次,稳居第一梯队、但突破有限的代表:GPT-5.6 Sol与Claude Opus 5。

二者依然牢牢占据头部位置,但未带来颠覆性升级。GPT-5.6 Sol在复杂推理与智能体编程能力上小幅增强,在Terminal-Bench 2.1(命令行环境任务完成能力评测)中达88.8%,Ultra模式进一步提升至91.9%;Claude Opus 5延续其在复杂工程、代码理解与安全分析方面的可靠表现,性能逼近Fable 5,价格却仅为后者一半。

两款模型虽仍在第一梯队,但缺乏重大技术跃迁。

北城坦言:“GPT-5.6基本覆盖我日常开发所需,遇到特别棘手的问题时,才会调用Opus 5。不过更强能力也意味着更高成本——对我而言,Opus 5更像是关键时刻启用的‘专家顾问’。”

最后,反馈两极、尚待验证的代表:Gemini 3.6 Flash与Qwen3.8-Max预览版。

最具代表性的是Gemini 3.6 Flash。其在Artificial Analysis智能指数中得分50,与前代3.5 Flash持平。开发者社区普遍反馈:本代升级不明显,综合表现亦逊于同期竞品。但也有声音指出,作为轻量级模型,其基础输出质量仍属合格。

独立开发者卡普迪姆认为:“Gemini 3.6 Flash日常使用体验流畅,虽然编程能力不算突出,但多模态理解依旧出色。它支持任意格式文件输入,聊天风格自然,文风体验甚至优于不少竞品。”

Qwen3.8-Max预览版7月上线后效果波动较大,市场评价分歧明显。北城感受最深的是其“思考深度高但易卡顿”:“有时陷入长时间推理,像自己绕进了逻辑迷宫,最终却没能给出有效解法。”卡普迪姆则直言低于预期——他用自建前端审美测评集测试发现,模型实际能力与宣传存在明显落差。作为尚未定型的预览版本,其最终表现仍需等待正式版发布后验证。

7月没有诞生“全能冠军”,不同模型正围绕具体场景形成天然分工。

以北城为例:GPT-5.6负责常规开发;Grok 4.5用于快速响应需求;Kimi K3专攻产品与前端设计;Claude Opus 5攻坚复杂难题。卡普迪姆的组合则不同:常用Claude Fable 5或Opus 5进行任务规划,再交由GPT-5.6 Sol执行落地。

03. 发布节奏加速,开源与闭源博弈再升温

这轮密集发布背后,藏着三个关键问题:为何迭代越来越快?为何集中爆发于7月?开源浪潮又将如何重塑商业模式?

首先,模型升级范式正在发生根本转变。以往,能力跃升依赖从头训练更大模型,周期长、成本高。而今,强化学习、后训练(即基础模型训练完成后,通过微调、RLHF等方式持续优化)等技术日趋成熟,模型进化更多依靠训练后优化。

姚宇航向「定焦One」透露:“近两年发布节奏明显加快,核心原因之一正是后训练方法日益成熟。现在许多能力提升无需重训整套模型,只需在既有基座上持续精调,借助强化学习或自我迭代即可达成。”

这意味着模型竞争周期正在压缩:过去一款领先模型或可维持数月优势;如今,版本更新带来的领先窗口可能仅剩数周。若发布节奏滞后,就极易被新版本反超。对厂商而言,发布本身已不仅是技术成果展示,更成为战略卡位的关键动作。

一个月9款旗舰,大模型进入“月抛”时代?

图源 / pexels

其次,7月恰逢多重节点交汇。对国内厂商而言,世界人工智能大会(WAIC)在此月举办,成为集中发布、技术秀肌肉的天然窗口;对海外厂商而言,多家头部公司亦选择同期更新模型,意在开发者生态与商业竞争中抢占先机。

再者,行业竞争规则正悄然改写。“模型够强”已非唯一目标,真正的较量延伸至“如何被用”与“如何变现”。

这也解释了为何开源与闭源之争在7月再度白热化。长期以来,开源模型与闭源模型之间存在客观能力差距。但随着Kimi K3、混元Hy3等进入第一梯队,一个现实拷问浮现:当高性能模型可免费获取,模型公司的API调用收入与订阅服务是否会遭遇分流?

开源阵营主张:开放权重能大幅降低技术门槛,激发更多企业与开发者参与AI创新;技术提供方让渡部分短期利益,实为推动整个生态繁荣。闭源阵营则担忧用户流失,Anthropic等公司更强调:模型能力越强,开放权重带来的安全与滥用风险越高,亟需更严格的治理框架。

这场争论背后,本质是不同利益主体的诉求博弈。对英伟达等基础设施厂商而言,模型开源意味着更多部署需求,等于更大的算力市场;对OpenAI、Anthropic等模型厂商而言,闭源模式仍是保障API与订阅收入的核心护城河。但另一面亦不可忽视:开源虽能扩大部署规模,但随着参数效率提升,单位任务的算力消耗也可能被摊薄,算力市场的增量未必与开源程度完全同步。对国内厂商而言,开放权重不仅是技术路线选择,更是争夺开发者生态、云服务入口及后续商业化主动权的战略支点。

7月之后,大模型竞逐不会停歇。开发者社区普遍预测,DeepSeek V4正式版、Fable 5.1、GPT-6等新模型将在8月陆续登场。

模型能力差距持续收窄,单靠发布一款“更强模型”已难以构筑长期壁垒。接下来真正值得关注的指标包括:DeepSeek V4正式版能否刷新开源模型能力上限;API价格是否会进一步下探;智能体能否出现稳定可持续的付费场景;以及开源模型能否真正进入更多企业的私有化部署体系。这些问题的答案,远比榜单排名更能揭示这场混战究竟改变了什么。

*题图来源于pexels 。

本文来自微信公众号 “定焦”(ID:dingjiaoone),作者:雷晶,36氪经授权发布。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

20

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

0

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

0

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

0

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

20

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

0

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

0

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

0

21

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

2026.09.22

20

25

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程