这回,ai已开启自主编写代码的新纪元!
GPT-5.6甫一发布,便接下首个重量级任务:全面重构自身的运行环境——一场深度“系统级焕新”。
它独立完成对OpenAI线上生产环境底层代码的重写与调优,直击核心——支撑大模型实际运行的GPU推理内核。
7月29日,OpenAI官方公布关键成果:
由GPT-5.6 Sol主导的内核优化,使整体服务成本下降20%;经其改进的推测解码机制,让token生成效率跃升超15%。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

此次GPT-5.6动刀的对象,并非沙盒中的演示Demo,而是正承载每日十亿级真实请求、全天候在线运转的生产系统。
正如OpenAI总裁Greg Brockman所言:“让GPT-5.6 Sol持续提升生产服务效能,正是它既强大又高性价比的关键所在。”

在OpenAI内部,一套成熟的方法论早已落地。Codex负责人Tibo(Thibault Sottiaux)将其精炼为两步走战略:
第一步:训练出足够强大的基座模型;
第二步:用该模型反哺自身——优化基础设施、推理栈乃至底层GPU内核。

20%的成本削减,究竟来自何处?
这20%的服务开销缩减,是如何实现的?
GPT-5.6 Sol通过Codex深度接入OpenAI生产推理栈,聚焦于四大核心模块:GPU内核、负载均衡策略、推测解码逻辑、KV缓存机制。

它在智能体框架层、API编排层、模型推理层同步发力,显著减少网络传输冗余、降低CPU调度负担、释放GPU计算潜能。
负载均衡,通俗讲就是避免部分GPU卡“过载烧机”,而其余卡却“空转待命”;
KV缓存,则是将已计算过的中间状态暂存复用,杜绝重复劳动;
推测解码,采用“小模型先抢答、大模型终审定”的协作范式——答对即批量输出,告别逐字生成的低效节奏。
再看GPT-5.6 Sol的具体行动:
它分析海量真实线上流量,精准识别以往被忽视的负载倾斜问题,并验证新型路由调度方案;
它自主重写了基于Triton与Gluon语言编写的生产级GPU内核,重点挖掘可预计算、可跳过、可并行的优化点;
在推测解码环节,它针对配套draft模型开展数百轮架构实验,全程自主启动训练、监控进度,甚至能在硬件异常或训练抖动时主动干预修复。
环环相扣的精细化打磨,最终凝结为开头那组硬核数据:服务成本直降20%,token吞吐效率提升15%+。
事实上,早在7月9日GPT-5.6正式亮相时,OpenAI就已埋下伏笔。
内部团队早已用它定位系统故障、调优训练流程、执行实验分析、解读结果报告,并专门设立KernelGen、NanoGPT、RSI Index等指标,评估其“自我增强”能力。
此次20%的成本优化,标志着这些长期投入,首次转化为财务报表上的真实收益。
比省下20%更深远的,是一个完整闭环的打通
真正具有里程碑意义的,是“自优化闭环”的首次全线贯通。
从流量分析→方案设计→代码生成→实验执行→故障处理→效果验证,整条链路如今几乎均可由模型深度参与。

单次任务中,模型持续执行“决策→调用工具→读取反馈→再决策”的循环,直至交付可用成果。
以推测解码为例:
为适配专用draft模型,GPT-5.6 Sol自主设计并运行了数百次结构实验——调整模型尺寸、修改网络拓扑、替换激活函数……
过去,这类探索极度依赖稀缺的GPU工程师,凭经验与直觉手动试错,耗时数月且覆盖有限;
面对指数级爆炸的配置空间,人类只能依赖粗略启发式规则“拍板”。
如今,模型将“测量—优化—验证”的周期压缩至极致,使团队得以快速验证更多创新构想,敏捷响应动态变化的业务负载。
更关键的是,这个闭环具备自我强化属性:
模型越强 → 推理栈越高效 → 同等硬件承载更多请求 → 更多用户使用更强模型 → 进一步反哺模型迭代。
OpenAI内部数据印证了这一飞轮加速之势:
GPT-5.6内测期间,每位活跃研究员的日均token产出达GPT-5.5时代峰值的2倍以上;
过去半年,用于内部代码推理的研究算力占比激增100倍;智能体相关token消耗量增长约22倍。
每一分节省下来的算力,最终都转化成了普惠更多用户的智能服务能力。
这是“AI自我进化”吗?
那么,这是否意味着AI已迈入“自我进化”阶段?
至少现阶段,答案是否定的。
GPT-5.6 Sol优化的对象,仅限于运行自身的软件栈、服务配置及辅助draft模型。
目前尚无任何证据表明它能在线修改自身主干权重,也未见其脱离工程师团队独立完成下一代模型的升级迭代。
若将模型权重视作智能的“货物”,则内核与配置只是运货的“卡车”与“路线”。本次优化聚焦运输效率,尚未触及货物本身。
因此,更严谨的表述应为:“自优化飞轮”的雏形初现,而非真正的递归式自我改进(Recursive Self-Improvement)。
还需注意一点:
官方虽使用“自主(autonomously)”描述内核重写与部分实验过程,但并不等于“全程无人干预”。目标设定、系统接入、工具选型、上线部署等关键节点,仍由OpenAI工程体系严格把控。
例如验证环节:模型生成的GPU内核必须通过人工审核方可上线。
OpenAI为此专门启用开源工具FpSan(浮点消毒器),对其数据流结构与数值行为进行双重校验。
自动验证能力的成熟度,才是决定“能否放心让AI编写底层代码”的真正瓶颈。
展望未来,OpenAI已在RSI(递归式自我改进)路径上持续铺路:
今年2月,GPT-5.3-Codex已被官方称为“参与了自身的诞生”;
本次GPT-5.6 Sol更进一步,自主完成了轻量级模型Luna的后训练;
在内部专属评测RSI Index中,其得分较GPT-5.5高出16.2分。

OpenAI内部RSI Index成本-得分曲线:GPT-5.6三档模型全面超越5.5与5.4,在同等性能下成本更低。
老对手Anthropic的观点更为前瞻:
人类当前仅需对个位数百分比的关键方向性决策负责。
联合创始人Jack Clark预测:到2028年底前,出现完整递归自我改进系统的概率超过60%。
飞轮已然转动,但“AI自主创造AI”的终极图景,仍在途中。
竞争焦点悄然转移:从拼GPU数量到比token榨取率
这20%的降本,意味着同一套硬件集群,OpenAI现在可多承接两成业务负载。
它折射出一个更深层的战略转向。
过去几年,AI厂商竞逐的核心指标是“谁拥有更多GPU”——逻辑直接,代价高昂。
但在算力永远稀缺、需求增速远超供给的世界里,另一维度正迅速崛起:同样硬件,谁能产出更多有效token?
推理效率,已与芯片数量并列,成为决定竞争力的核心杠杆。
OpenAI自身的产品策略已给出明确信号:
GPT-5.6首次推出Sol、Terra、Luna三档差异化版本,核心卖点正是——“同等智能水平,更低token消耗”。
效率,已被提升至与智能本身同等重要的战略地位。
而这一次,驱动推理效率跃升的引擎,正是模型自身。
模型越强 → 越能优化推理栈;
推理栈越高效 → 同等硬件服务更多token;
成本越低 → 更强模型越易规模化落地。
这个正向飞轮,OpenAI已成功启动。
参考资料:
https://www.php.cn/link/56e35bb7fdbbc6570acb607ad4ab4be0
https://www.php.cn/link/f20848a781e3554b876afadc3dc3281a
https://www.php.cn/link/f535640eb9d804cee5b539fdd800d8b3
https://www.php.cn/link/cc5eafbcaff63bb2d5b8fa02b30cd8d8
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。











