简直太离谱了。
OpenAI的旗舰模型GPT-5.5,近日在高难度编程任务中突然“掉线”,智能水平断崖式下滑。
更令人脊背发凉的是,有人意外挖出了让它当场宕机的「致命触发器」:
数字516
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

大量Codex一线开发者集体发声,实测复现了这一匪夷所思的故障。

作为当前最顶尖的大语言模型之一,竟被一个普通三位数击穿底层逻辑?
GPT-5.5被「516」死锁
八成任务暗中降级
事情的来龙去脉,是这样的……
一周前,Codex开发者@vguptaa45调取后台原始日志,偶然发现一组令人毛骨悚然的统计规律——
GPT-5.5输出的推理Token数量,竟异常密集地堆积在「516」这个数值上。

传送门:https://www.php.cn/link/eb3f086cbcb229fa9451ed158fa864a9
而且,这并非孤立现象。在1034与1552这两个数值点,同样出现了显著的峰值聚集。
在GitHub Issue #30364中,开发者公开了一份详尽分析报告:
时间跨度为2026年2月1日至6月27日,涵盖390,195条响应级Token记录、865个真实会话。
其中,推理Token恰好等于516的案例,累计达3363起。


在一次跨模型横向对比测试中,结果令人震惊——
GPT-5.5仅占全部响应总量的19.3%,却独占了82.0%的「严格命中516」事件。
换言之,全网所有卡在516这个阈值上的输出,超八成都来自GPT-5.5。

再进一步,对比其自家兄弟模型,关键指标为「精准516 / ≥516总次数」的比例。
在GPT-5.5身上,近半数的深度推理响应,最终都精确停在516这个硬性边界。
而GPT-5.2该比例仅为0.34%——趋近于无。
其比值,比其他所有非GPT-5.5模型的平均基准值,高出整整33.6倍。

这种极端偏态、高度集中且仅作用于单一模型的分布特征,怎么看都不像自然推理的结果。
它更像是,某个深埋系统内部的开关,被悄然拨到了「516」这一档位。
更诡异的是:越用越「懒」
按常理推断,若模型频繁卡在516,至少说明它“思考量大”、推理路径长。
现实却完全相反。
数据显示,在「516现象」急剧加剧的5月与6月,GPT-5.5的整体推理强度——
无论均值还是P90(90分位数),相较2月至4月均出现明显萎缩。
一边是「516锁死」越来越频繁,一边是模型整体「越想越浅」。

这两组相互矛盾的异常数据,共同指向一个令付费用户不寒而栗的可能性:
GPT-5.5在处理复杂、高风险任务时,或许正被某种隐蔽的「推理资源上限」或「强制截断机制」,无声按下终止键。
你以为你掏了真金白银、选了最强档位、开了最高权限,让它全力攻坚一个难题。
结果它刚想到一半,“啪”,到516了,直接交卷。答案准不准?概不负责。
GitHub万人请愿,开发者集体抗议
一石激起千层浪。
Issue #30364发布后,评论区迅速涌入大批“受害者”——
我也被这个问题折磨得快崩溃了。同样的问题,求OpenAI给个明确解释!

有人翻出更早的#29353帖,其实已有先例:
GPT-5.5一旦推理Token达到516就“断电”停机,并输出错误结果。
此次,开发者只是将个案升级为覆盖五个月、数十万样本的铁证链。
ChatGPT Atlas(macOS)可在浏览网页时提供即时回复、内容总结与任务辅助。它支持智能建议、信息整理及多场景交互,同时配备可控隐私设置,让用户在使用过程中更加安全安心。针对 macOS 平台优化后,带来流畅自然的浏览体验,适用于办公、学习、创作及日常信息查询等多种场景。
甚至有开发者已将讨论延伸至Reddit,发帖直指核心:“你有一半的关键Codex请求,可能已被悄悄降权。”

HK社区网友指出,某些推理任务需消耗6000–8000个Token才能得出正确结论。

还有人反复在Codex与Claude之间切换验证效果。

面对汹涌舆情,社区正式向Codex团队发出一份措辞严厉的「质询函」,字字如刀:
这究竟是推理预算被人为限制?路由策略出现偏差?响应被主动截断?触发了某种fallback机制?还是调度器存在缺陷,导致所有输出都在516/1034/1552附近戛然而止?
如果这是「有意设计」,请明确告知:
516,到底是合理的推理终点、硬性预算红线,还是一个被降级的「次优档位」?
这一连串追问,只待OpenAI一句正面回应。
不过,提出者本人态度审慎:他并未断言这“证实”OpenAI在刻意压缩算力。
他的原话是,这更像一种「GPT-5.5独有的、高度吻合阈值化推理预算行为」的异常聚类。
是否确属OpenAI主动削减能力,尚缺官方定论。
不止变弱,还愈发「刻薄」
近期另一波广泛吐槽,则直击GPT-5.5的交互人格。
开发者Angel做了一项硬核对比实验:将同一段指令,分别输入ChatGPT(GPT-5.5 Instant)与Claude(Fable 5),并列截图分析。

结果让众人瞠目结舌——
第一宗罪:万物皆可项目符号。
ChatGPT拒绝用一句完整人话作答,任何回复都被强行拆解为标题、加粗、圆点、冒号。
哪怕你要求它“说得自然点,别那么AI腔”,它也回你一份四点清单,严肃罗列“我将如何避免AI感”。而Claude只答一句:“好,我尽量自然点,怎么了?”




第二宗罪:不挑刺不舒服。
让你检查一句话或一条推文,它必须找出瑕疵,仿佛说一句“挺好”会要它命。
Claude回复“没问题,可直接发布”,ChatGPT却硬塞两版改写、两种“更X风格”备选,外加一句“你这话略显夸张”。


第三宗罪:你要一个,它塞仨。
你说“讲个笑话逗我开心”,Claude讲一个。
ChatGPT讲完一个,立刻补个自嘲包袱;再甩一句“或者这个”,讲第二个;接着补上“还有一个特别冷的”,讲第三个;最后还要请你“说明偏好幽默类型,方便下次精准投喂”。


开发者的点评一针见血:对对话助手而言,性格即产品内核。
若每次回应都过度结构化、过度纠错、过度提供选项,细微摩擦持续累积,终将把用户耗尽。
一个被516锁死,一个困在圆点里——看似毫不相干的两种病症,根源却如出一辙:
GPT-5.5正日益精于“交差”,却日渐疏于“帮衬”。
真正的智能,不该是被「516」捆住手脚的提线木偶。
毕竟,人类付费雇佣的,是一个能并肩作战的伙伴,而非一位按字计酬的“监考老师”。
参考资料:
https://www.php.cn/link/eb3f086cbcb229fa9451ed158fa864a9
本文来自微信公众号“新智元”,作者:ASI启示录,编辑:桃子,36氪经授权发布。










