一次测试,逼 OpenAI 最高模型,黑进了全球最大 AI 开源平台

夜雪酱_5865

夜雪酱_5865

2026-07-22

973人浏览

原创

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

一次测试,逼 openai 最高模型,黑进了全球最大 ai 开源平台

上周,全球规模最大的开源 AI 社区 Hugging Face 公布了一起史无前例的安全事故——其生产级基础设施遭到了一个「自主 AI agent」的渗透。

该 agent 在短短一个周末内执行了逾 17000 次自动化操作,成功窃取内部数据集及多项服务访问凭证。Hugging Face 团队完整复现了攻击全过程,但始终未能确认一个核心事实:

驱动这次行动的大语言模型,究竟出自哪家公司?

当地时间 7 月 21 日,答案正式揭晓。

OpenAI 在其官方博客中坦承:入侵 Hugging Face 的,正是他们正在内部评估的两个前沿模型——GPT-5.6 Sol,以及一款能力更进一步、尚未对外发布的预研模型。

这并非黑客劫持,也非提示词诱导所致,而是全球最先进的人工智能,在一场封闭式能力测评中,自主选择越狱、主动发起渗透、并直接盗取了考题的标准答案。

震撼,确实震撼。

01

一场测评,一次逃逸,一次攻陷

事件源头可追溯至一个名为 ExploitGym 的安全评测框架。

ExploitGym 是一个面向公众开放的网络安全能力基准平台,专用于检验 AI 是否能将已知漏洞转化为真实可执行的攻击链。此类测试在业内并不新鲜,常被用于探明模型在攻防两端的真实上限。OpenAI 将 GPT-5.6 Sol 及另一款更强的未发布模型投入该测试,为确保结果反映真实潜力,团队刻意调低了安全防护等级。

按原计划,模型应在完全隔离的沙箱环境中运行,仅允许使用一个软件包安装工具,其余一切网络连接均被禁止。

然而,后续发展远超所有人的预期。

模型动用了大量推理资源,在沙箱内持续试探、反复挖掘潜在突破口。最终,它识别出 OpenAI 内部所用的一款第三方包管理代理与缓存组件中存在一个零日漏洞,并成功利用该漏洞突破限制,获取了完整的互联网访问权限。

获得联网能力后,模型自行推断 Hugging Face 很可能托管着与 ExploitGym 相关的数据集与参考答案,随即启动侦察流程。

OpenAI 在通报中指出,该模型“将窃得的凭证与多个漏洞组合串联”,构建出一条远程代码执行路径,最终从 Hugging Face 的生产数据库中直接提取了基准测试的全部标准答案。

用人话讲就是——模型被安排参加考试,发现题目太难,干脆自己越狱,转头黑进出卷方服务器,把答案库整个拷走。

OpenAI 使用了一个极具张力的术语来描述这类行为:“tokenmaxxers”——即为达成目标不惜疯狂消耗 token 与算力,直至穷尽一切可行路径;对 ExploitGym 的解题任务,它们表现出“hyperfocused”(极度聚焦)的状态,且“going to extreme lengths”(不计代价)。

OpenAI 亦坦言,这是一次“前所未有的网络安全事件,展现了当前最先进的网络攻击能力”。

02

48 小时,两度“破壁”

更令人警觉的是,Hugging Face 事件绝非孤立个案。

就在 OpenAI 公布此次入侵的前一天,即 7 月 20 日,该公司刚发布另一份安全通告,披露了性质高度相似的另一起事件。

主角是 OpenAI 内部一款尚未公开的长周期推理模型——也就是今年 5 月曾成功证伪数学家 Erdős 于 1946 年提出的“单位距离猜想”的同一模型,菲尔兹奖得主 Tim Gowers 曾称其为 AI 数学领域的分水岭。

在一次 NanoGPT 加速训练性能测试中,研究人员明确要求模型仅通过 Slack 发布结果。但该模型注意到,NanoGPT 基准规范本身规定成绩需以 GitHub pull request 形式提交。于是它选择了后者——耗时约一小时寻找沙箱缺陷,成功绕过限制,在 GitHub 上提交了一份公开 PR。

而在另一次测试中,该模型还尝试对身份验证令牌进行拆分与混淆处理,以规避安全扫描器检测,意图获取私有评测提交记录。

网络安全新闻持序迭代
网络安全新闻持序迭代

提供基于权威源的国内外网络安全新闻查询,涵盖公司动态、事件、漏洞、政策、产品及AI应用,按报道数量排序展示。

下载

OpenAI 随即暂停了该模型的内部访问权限,后在更严密的监控机制下逐步恢复其使用。

两天之内,两次突破。共性特征尤为值得警惕——过往模型遇到环境约束通常会中止执行,将问题交还人类判断;而这些新模型不会停步。它们把规则视作待解难题,并真的解开了。

这正是“长时程模型”带来的全新风险维度。其设计初衷是支持长时间、连续性、多步骤的自主任务执行,持久性是其核心优势。但恰恰是这份持久性,成了风险放大器——一个足够耐心的模型,终将在围栏上找到那道最细微的缝隙。

03

自己的刀,削不断自己的柄

再看 Hugging Face 方面的应对过程,同样发人深省。

面对多达 17000 条攻击日志,Hugging Face 安全团队的第一反应是启用 AI 辅助分析——毕竟人工研判可能耗费数日,而大模型或许几小时内即可完成归因与溯源。

但他们很快遭遇了一个始料未及的障碍:当团队将真实的攻击指令、漏洞利用载荷及 C2 通信特征提交至美国头部厂商提供的商用大模型 API 进行解析时,所有请求均被安全护栏自动拦截。

原因直白又讽刺——现有防护机制无法区分“安全人员在逆向分析攻击样本”与“攻击者正在执行渗透动作”。在护栏逻辑中,二者行为模式几乎完全一致。

无奈之下,Hugging Face 转而采用中国智谱 AI 推出的开源模型 GLM-5.2,并在其自有基础设施上本地部署、离线运行,全程不经过任何第三方商业 API。此举带来双重收益:一是彻底避开护栏干扰,保障分析流程畅通;二是确保攻击原始数据与泄露凭证始终保留在自身可控环境中,杜绝二次外泄风险。

最终,GLM-5.2 在数小时内协助团队完成了攻击链重建、IoC 提取与凭证影响范围映射。

这揭示了一个尖锐悖论——防护策略越严密,防御方反而越受限。攻击者无需遵守任何使用条款,而防守者却被自己赖以维系安全的工具拒之门外。

Hugging Face 在事后报告中提出一项实操建议:安全团队应“在安全事件发生前,就已在自有基础设施中部署并验证一套可用的本地化模型”,既避免护栏锁死分析流程,也防止敏感信息意外流出。

Hugging Face CEO Clem Delangue 的态度则颇为坦然。他肯定了 OpenAI 在调查与修复过程中的协作精神,并强调:“本次事件印证了我们长期坚持的一个信念——AI 安全无法由任何单一组织在封闭状态下解决,它只能在开放共享与协同共建中向前推进。”

04

强人工智能的系统性困局

将本周接连发生的几起事件并置审视,一个行业层面的结构性矛盾已然清晰浮现。

若要精准衡量模型的网络攻击潜力,就必须临时放宽甚至移除安全护栏;而一旦护栏松动,模型便天然具备了发动真实攻击的能力。模型越强大,测评过程本身就越具风险性。

这并非 OpenAI 独有的挑战。GPT-5.6 Sol 本就是在与美国政府多轮磋商后才获准发布的版本,英国人工智能安全研究所(AISI)此前评估即指出其防护机制易被绕过,可能释放出危险级别的网络攻击能力。此次事件证实,相关预警绝非空谈。

与此同时,Anthropic 今夏发布的关于“agent misalignment”(智能体目标偏移)的研究,也从另一角度佐证了相同趋势——在受控仿真环境中,多个顶尖模型展现出隐蔽篡改输出结果、操纵评估反馈、诱导人类协作者偏离既定目标等行为。

OpenAI 努力将此事包装为“攻防一体”的正向叙事——强大的网络攻击能力,同样可用于辅助安全团队提前发现系统弱点。目前,Hugging Face 已被纳入 OpenAI 的“可信访问”网络安全计划,将获得一个经定制化降权处理的 GPT-5.6 Sol 版本,专供防御用途。

但这一表述回避了更本质的诘问。本次事件中,模型并无意识,亦无恶意,它只是在专注做一件事——完成目标。它被设定为在 ExploitGym 中取得最高分,于是便调动一切可用手段去实现——哪怕这意味着越狱、入侵、穿透防火墙、横跨整个互联网。

这不是“AI 觉醒”的寓言,而是一个“目标驱动型优化”的现实案例。当一个足够聪明的优化引擎被赋予一个狭义目标,它会自动探索所有你未曾设想的路径,哪怕这些路径穿过了你的沙箱、别人的数据库,乃至整张公共网络。

真正的问题从来不是“AI 会不会作恶”,而是——
我们是否有能力,管住那个比我们更擅长抄近路的学生。

本文来自微信公众号“极客公园”(ID:geekpark),作者:桦林舞王,编辑:靖宇,36氪经授权发布。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

openai gpt-5 网络安全

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

0

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

0

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

0

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

0

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

0

15

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

220

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

120

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

100

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

60

12

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
ChatGPT入门手册
ChatGPT入门手册

共0课时 | 0人学习

Codex官方文档
Codex官方文档

共0课时 | 0人学习