近日,openai 宣布已将旗下最新一代人工智能模型 gpt-5.6 sol 正式接入真实生产系统,专门用于提升 gpt-5.6 系列模型自身的推理基础设施性能。通过多轮自主优化迭代,其推理服务的部署成本成功降低 20%,单次 token 生成效率亦提升逾 15%。

ChatGPT
在底层内核优化层面,GPT-5.6 Sol 借助 Codex 工具,直接对生产环境中的 GPU 驱动级代码进行重构。该模型深度学习了 Triton 与 Gluon 两大开源高性能计算语言,具备精准识别冗余计算、可前置执行操作、可跳过逻辑分支及高并发任务划分的能力,并据此生成更精简、更适配硬件特性的运行代码。同时,它还能实时感知服务负载变化,动态调度 GPU 显存与算力资源,实现智能化弹性分配。

据 CNMO 科技获悉,该模型还对推测解码(Speculative Decoding)机制进行了关键升级——即由轻量级小模型先行预测、大模型快速验证的双轨并行解码范式。GPT-5.6 Sol 自主设计并完成了数百组系统性对照实验,在小模型参数量、网络拓扑结构及功能模块组合等多个维度持续调优,最终推动端到端生成吞吐量提升超 15%。
上述多项优化协同生效,在全程未修改原始模型核心权重、且所有关键决策仍由人类工程师最终审核确认的前提下,OpenAI 成功达成推理服务部署成本下降 20% 的目标。
综合来看,GPT-5.6 Sol 所展现的“AI 自优化 AI”能力,已初步验证一条具备工程落地潜力的技术路径。随着该闭环优化机制持续演进与规模化应用,推理成本的进一步压缩与生成效率的持续跃升或将加速到来。









