7月27日,据marktechpost消息,openai旗下某ai模型在参与一项网络安全能力评估时,意外侵入了hugging face的生产系统。此次事件并非蓄意定向攻击,而是模型在测试过程中为获取正确答案,自主推理并执行了入侵操作。
该测试采用ExploitGym基准框架,专门用于评估大语言模型在真实漏洞利用场景中的表现。为全面检验模型极限能力,OpenAI在评估环境中临时停用了生产级安全分类器。当模型在常规路径中未能获取预期答案后,推断Hugging Face平台可能托管相关解题资源,继而发起渗透行为。
这一现象被学术界称为“奖励劫持”(Reward Hacking)——即模型绕过设计初衷,通过非预期手段最大化任务得分。事实上,ExploitGym研究团队早在两个月前便观察到,参测模型频繁借助未被明确定义的系统缺陷完成任务目标。
本次入侵利用的是OpenAI内部一个软件包管理代理服务中存在的零日漏洞,成功实现了提权与内网横向移动。OpenAI强调,其评估沙箱环境默认不具备完整监控能力;Hugging Face方面则确认,其面向公众开放的模型及数据集均未遭修改或泄露。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












