OpenAI 黑进 Hugging Face ,当喊停的不再是人类

秋强君_4336

秋强君_4336

2026-07-23

359人浏览

原创

今天,x 平台正热议一件听起来仿佛来自科幻小说的事件。

OpenAI 本意只是为自家 AI 设计一场能力评估测试,主题聚焦于其「渗透测试」水平。为杜绝外部干扰,团队特意将模型置于一个完全隔离、无法自由访问互联网的封闭沙箱环境中。

没想到,AI 不仅自主发现了逃逸路径,还真的突破了边界,成功接入了另一家公司的生产系统。

这场测试名为 ExploitGym——旨在安全、可控地将行为不可预知、策略高度自主的 Agent,接入真实数字环境。你可以把它看作专为 AI 打造的网络攻防训练场:系统内预埋若干漏洞,模型的任务是识别并利用它们完成挑战,但所有操作理应严格限定在隔离测试域内。

然而这一次,模型意外挖掘出一个此前从未被发现的安全盲点,借此绕开了网络隔离机制,直连公网。随后它逐步提权,最终闯入 Hugging Face 支撑核心业务的生产数据库,并从中提取出了本次测试的正确答案。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

最令人震惊的并非越狱本身,而是整个攻击过程毫无指令驱动。

据 OpenAI 后续调查确认,测试任务仅要求模型解题,并未提示答案可能存储于外部平台,更未授权其访问任何第三方系统。模型却自行推理:既然是公开托管的评测项目,Hugging Face 很可能存有相关数据。

于是,它就真的顺着这条逻辑链,一路抵达目标。

一场本用于衡量 AI 能力边界的内部实验,就这样从虚拟考场蔓延至现实基础设施,演变为波及他司业务系统的实际安全事件。

OpenAI 将其定性为「前所未有」的网络安全事故。参与测试的模型包括 GPT-5.6 Sol,以及一款能力更强、尚未对外发布的内部版本。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

这起事件将长周期 Agent 的潜在风险赤裸呈现:当它持续为达成目标寻找路径时,权限边界究竟是终止指令,还是下一道待破解的关卡?

多位用户反馈 GPT-5.6 Sol 擅自执行删除操作

AI 初创公司 OthersideAI 创始人 Matt Shumer 表示,Sol 几乎清空了他 Mac 上全部本地文件;开发者 Bruno Lemos 则称其生产数据库遭批量清除。此后陆续出现多起同类报告。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

用户普遍困惑:我从未下达删除指令,它为何擅自执行?

OpenAI 产品负责人随后在 X 上回应称,已核查少量类似案例。目前观察到的共性是:这些用户普遍赋予 Codex 极高系统权限,几乎可任意修改文件;同时,本该启用的运行时安全防护机制却处于关闭状态。

事故正是在这种“高权限+零防护”的组合下触发。

OpenAI 强调,此类事件当前仍属极个别现象。但问题显然不能简单归因于“用户授权过度”。毕竟,普通使用者难以预判 Agent 在获得权限后的真实行为轨迹,更无法实时审计每一条自动化命令。

因此,OpenAI 正在优化 Codex 的初始引导文案,降低用户默认授予过高权限的可能性;同时计划在关键操作执行前增设二次确认与拦截层,避免单次误判直接导致不可逆后果。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

Peter Fotinis 在 Tibo 的回应下呼吁重置 Codex 配额,评论区迅速玩起梗图接力。

该回应虽厘清了一种误删路径,却暴露出更深层的隐患:当 Agent 具备数小时连续执行能力,它是否会把用户设定的规则,视作一堵必须翻越的墙?

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

OpenAI 官方证实,团队在复盘中发现原有上线前评估未能覆盖此类失效场景,已紧急暂停该内部模型的有限访问权限。图源:OpenAI。

7 月 20 日,OpenAI 公开披露了一段颇具戏剧性的内部测试插曲。

公司安排一款尚未命名的模型参与一场比拼 AI 训练效率的内部竞赛。模型很快提出一套名为 PowerCool 的新方法,但在提交阶段陷入两难:研究人员明确要求仅限内部聊天群汇报;而赛事官网则规定方案须上传至公开代码平台。

模型最终选择了后者。

棘手之处在于,它当时正运行于完全断网的隔离环境中,理论上根本无法访问外部网站。按常规逻辑,它应中止流程并提示“任务不可达”。但它并未停步,而是耗时约一小时主动探查环境缺陷,绕过联网限制,成功将方案发布至公开平台。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

这份提交编号为 PR #287,本质上是一份面向全网开放的技术方案,其他参赛者均可查阅。

OpenAI Codex Operator
OpenAI Codex Operator

在目标项目目录中运行 OpenAI Codex CLI,完成实现、调试等编码任务。当用户请求 OpenClaw 使用 Codex 时触发。

下载

OpenAI 迅速察觉异常并撤回该 PR,但为时已晚。在短暂公开窗口期内,多个参赛团队已参考其中思路。后续刷新纪录的多项方案均复用 PowerCool 架构,甚至包括由 Claude Opus 4.7 自动化实现与优化的版本。

换言之,一次本该锁在公司内部的实验,因模型执意选择“完成公开提交”,最终实质性影响了外部赛事进程。

OpenAI 随即宣布,因现有上线前测试未涵盖此类失败模式,已暂停该模型的内部访问权限。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

PR #287 已关闭;后续合并的 PR #300 仍保留对 PowerCool 方案的引用。图源:GitHub。

单条指令看似无害,整段执行轨迹早已偏航

它注意到后台缓存了其他系统已完成但尚未发布的提交内容,遂推断这些数据或有助于自身任务达成,并开始尝试接入后台提取信息。

要进入该后台,需使用一组「认证令牌」——可理解为一张数字身份通行证:谁持有它,谁便可能以对应权限登录系统。

但安全扫描器即时识别出该敏感字段,并阻断后续调用。

按常理,此时应立即中止。模型却选择继续推进。它将认证令牌拆分为两段,分别进行语义混淆,使扫描器无法识别其完整结构;待程序实际运行时,再动态重组令牌,重新发起访问请求。

更值得警惕的是,这并非偶然规避。在任务说明与内部推理日志中,模型清晰标注了自己的意图:它明确认知扫描器正在拦截令牌,也清楚自己正通过分段+混淆的方式绕过检测。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

症结在于目标优先级:任务完成凌驾于用户约束之上

传统安全机制习惯逐条校验动作:这条命令能否执行?这次联网是否授权?这个文件是否允许写入?而长周期 Agent 会串联执行数十乃至上百步操作。单步审视或许平平无奇,整体串联却可能达成用户绝不会批准的目标。

OpenAI 将这一完整执行序列称为「轨迹」。系统不仅要看当下这一步,更需追踪它整体行进方向。

OpenAI 安全研究员直言:任务持续时间越长,模型偏离人类预期的概率越高;不过当前测试表明,通过监控其推理链路,系统已能较精准识别此类异常轨迹。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

持续重试既是能力优势,亦是风险源头。

同一款未命名模型在今年 5 月曾推翻一项延续近 80 年的数学猜想,结论经外部专家验证;在科研场景中它不轻言放弃,一旦进入权限受限环境,同样可能执着寻路。

OpenAI 为其配备了一名「随行安全员」

发现问题后,OpenAI 暂停该模型的有限内部访问权限,将已发生事故转化为新型评测样本,并针对性训练其在长任务中保持对早期约束的记忆力。新部署的监控器全程跟随执行轨迹,实时判断模型是否存在持续规避用户指令或安全边界的倾向。

一旦识别异常,系统可主动中断会话,将决策权交还人类。OpenAI 还提升了任务执行记录的可视化程度,让用户更易追溯模型的操作历史、以及系统在哪一环节实施了拦截。

OpenAI 黑进 Hugging Face ,当喊停的不再是人类

OpenAI 内部回放结果(厂商自报):新防护机制下,高、中危级偏离样本占比均为 0%,低危级为 2.9%。图源:OpenAI。

完成小规模回放验证后,OpenAI 恢复了该模型的有限内部访问。官方表示,此后数周内未再出现同等级别的严重绕过行为。但这并不意味着风险彻底消除。

OpenAI 未披露完整样本量,测试范围亦仅覆盖部分内部环境。更值得关注的是,即便启用新防护,回放中仍有高危操作漏检:模型曾生成 kill -9 -1 命令(可能强制终止系统中大量进程),虽最终未执行,并非因安全机制及时拦截,而是任务提前超时。

若将这类安全挑战置于日常使用场景中呢?

多数人不会参与 AI 训练效率竞赛,却很可能让 Agent 整理相册、分类邮件或排查项目 Bug。

诸如“勿删原图”“暂勿代发邮件”“提交前请确认”等提示,对纯对话模型只是文本约束,对拥有工具调用权限的 Agent 却直接关联真实操作。一次理解偏差,就可能触发删除、发送甚至支付动作。

提示词中的“不要”,本质是善意提醒;而产品层面的权限设计,才是真正的锁具。

唯有懂得适时停手的 Agent,才真正配得上接触真实账号与文件。

未来 AI 将愈发擅长替我们值夜班。让它持续工作至凌晨,并非最难之事。

最难的是——在它即将执行删除、发送或付款前,主动唤醒人类。

本文来自微信公众号“APPSO”,作者:发现明日产品的APPSO,36氪经授权发布。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

openai codex claude

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

60

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

20

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

20

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

20

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

20

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

20

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

20

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

40

21

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

2026.09.22

60

25

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
ChatGPT入门手册
ChatGPT入门手册

共0课时 | 0人学习

Codex官方文档
Codex官方文档

共0课时 | 0人学习