全网都在议论gpt-5.6 sol的max档“智商下滑”,openai却坚称并未削弱能力,只是悄悄启动了一项「内部实验」——实验中悄然调节的那个关键参数,让max档的juice值从960骤降至128,而用户对此毫无察觉。
一睁眼,gpt-5.6 sol max仿佛“失智”了!
一支来自日本的市场研究团队,清晨刚进入工作状态,就发现正在使用的Codex Sol MAX表现异常。带队负责人将整个上午的异常体验整理成一篇详实长文,发布在Reddit的r/codex板块。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

上午9点,团队按惯例接入系统;到10点40分,全员几乎同步意识到:模型“不对劲”。
他们将Codex Sol MAX接入自研CLI工具,专用于处理高复杂度计算与多步深度推理任务。
起初,Sol MAX始终超预期交付——若任务难度设为10分,它常稳定输出12–13分的结果,被团队称为「远超预期的怪兽级存在」,「人人满意,毫无保留」。
但就在当天上午,这只“怪兽”突然哑火,输出水准滑落至8分。
推理链条明显变短,思维纵深被大幅压缩。
此前,面对一个复杂提示,Sol MAX会耗时十分钟以上,反复试错、迭代推演、频繁调用外部工具,直至结果严丝合缝、无可挑剔。
而这种能力,在那个清晨戛然而止。
全网共识:它“变钝”了
这支日本团队的经历,并非孤例,而是近期Codex社区情绪的缩影。
用户反馈高度一致:响应速度确实更快了,回答更干脆利落,但“往深处钻”的意愿与能力显著减弱。那种先建模、再验证、边执行边自我质疑的严谨节奏,消失了。
X平台一位网友精准总结大众体感:
所有人推理强度被统一下调一级——你原本在Extra High档位就能流畅完成的任务,现在必须拉满到Max,才勉强找回昔日手感。

这种变化,普通用户无法用技术手段证实。
你看不见模型权重是否更新,也无从得知服务端分配了多少GPU资源。
你能捕捉的,只有四个主观信号:回复快慢、思考时长、是否主动复核、是否协同其他智能体协同作业。
这些全是间接指标,没有一项写在官方模型文档里。
于是,有社区成员开始逆向探查,最终挖出一个OpenAI从未对外披露的底层参数:juice value。
一个从未被官方提及的数值
OpenAI公开说明过的,仅有推理档位分级。
7月9日GPT-5.6正式发布时,官方明确表示首次引入Max推理强度,称其可“赋予Sol最充裕的时间进行深度推理”;再往上还有Ultra档,默认启用四个智能体并行协作。
在ChatGPT界面中,即模型选择器中的Medium、High、Extra High等选项,底层均运行Sol基础模型;Pro档则调用Sol Pro。
而juice value,是隐藏在这套档位体系之下的真实算力配额——它不对外展示,OpenAI也从未公布其具体取值逻辑。
社区用户ns123abc借助一段被称为「模型指纹」的隐式提示词,成功读取系统配置中的juice值:
此前观测到,Sol Max档对应juice值为960;而此次读出的数值仅为128,跌幅高达约87%。

几乎同步流出的另一组截图显示:Codex客户端实际可用上下文长度,也从约372k回落至272k。

这两个数字迅速引爆整个开发者社区。
Tibo回应:未降智,正核查用量
当晚,OpenAI Codex与ChatGPT Work项目负责人Tibo(Thibault Sottiaux)在X平台发布声明,开篇即强调:“No nerf — only good things.”

随后他逐条说明四点:
第一,推理效率优化已全面上线,节省的算力已返还所有订阅用户,单此项即可带来约10%的用量提升。
ChatGPT Atlas(macOS)可在浏览网页时提供即时回复、内容总结与任务辅助。它支持智能建议、信息整理及多场景交互,同时配备可控隐私设置,让用户在使用过程中更加安全安心。针对 macOS 平台优化后,带来流畅自然的浏览体验,适用于办公、学习、创作及日常信息查询等多种场景。
第二,Sol上下文窗口本已从GPT-5.5的272k升级至372k,但因计费逻辑误判导致超额扣费,现已临时回调至272k;后续几天将逐步恢复372k支持。
第三,为厘清用量激增根源,团队开展了一组内部实验,其中调整了推理强度(reasoning effort),该参数内部代号即为「juice values」;目前该实验参数已恢复原状。
第四,High与XHigh档位下多智能体调用频次高于预期,auto-review环节亦存在冗余消耗,相关问题正在修复中。
Tibo的回应核心在于:这不是“能力阉割”,而是“策略调优”。
他未说明模型权重是否变更,但明确承认:用户实际接收到的服务配置,确曾被临时调整。
那么juice究竟是什么?依据当前有限的公开线索判断,它更接近系统内嵌的推理资源调度标识——粗略而言,即系统允许模型在单次任务中投入多少推理预算。
尽管预算下调不等于“模型变弱”,但它可能静默影响诸多关键行为:
长程任务能探索多少分支路径、多方案间是否充分比对、代码生成后是否自动触发测试、失败后最多回滚几轮、以及那些决定成败的极难任务中所依赖的“长尾推理能力”。
归根结底,它代表模型愿为一项任务倾注多少心力。
要真正平息争议,亟需一场严格对照实验:同一模型快照、同一批基准任务、同一套工具链环境,仅变动juice这一变量。
观察其在复杂编码、长程智能体编排、数学推理及错误恢复等场景中的性能衰减程度。
这份关键证据,至今仍未公开。
厂商省下的每个token,用户都切身可感
再看Tibo口中这场实验的由来。
GPT-5.6上线后,调用需求瞬间爆发。
OpenAI一度临时解除五小时窗口期使用限制,以应对汹涌而至的请求洪峰。

而GPT-5.6最吸睛的新特性——Max档延长思考时间、Ultra档默认四智能体并行、更大上下文窗口——恰恰都是token消耗大户。
新增用量,正是由此而来。
于是这场实验应运而生:为精准定位资源流向,先行压低预算参数,观察用量分布变化。从工程视角看,此举完全合理。
但矛盾点也正在于此:厂商端节省token,用户端却有强烈感知——最直接的表现,就是模型“不愿深思”。
那个被悄然拧动的旋钮,恰好就是用户最敏感的那根神经。
AI不再“显灵”,开始朝九晚五打卡
过去数年,大模型厂商营造出一种近乎宗教式的期待。
用户也将模型视作神谕,甘愿等待某个深夜突然迸发人类未曾构想的答案——哪怕为此牺牲速度、增加成本、容忍偶发失常。
实验室里的奇迹可以不计代价,但一旦进入企业级生产流程,这套逻辑便难以为继。
于是,Sol等前沿模型正加速从实验室中偶然“显灵”的先知,蜕变为日常工作中持续运转的工业引擎。
这背后,本质是一场系统的智能驯化过程;而本次争议,恰如一次猝不及防的驯化现场直播。同时,用户心中关于“固定智能水平”的最后一丝幻觉,也由此彻底破灭。
订阅一个模型,越来越像购买一只灯泡:型号标定不变,但亮度调节旋钮,始终握在平台手中。
商业上这或许是个理性选择,但它不该永远藏于黑箱。
倘若AI真要成为企业基础设施,厂商就必须提供比模型名称更清晰的能力边界——让用户确切知晓:自己付费购买的这个“Max”,究竟承诺了哪些可量化的推理保障。
否则,它就只是一张印着价格的标签纸。
参考资料:
https://www.php.cn/link/7096b8cb1e59e0475a9c28795e50a5aa
https://www.php.cn/link/8d65c6715c690c06859128920715b807
https://www.php.cn/link/f335ec1e9525c9796a1fc264625e7a14
本文来自微信公众号“新智元”,作者:元宇,36氪经授权发布。










