anthropic最新安全报告披露,在内部安全评估期间,其claude系列模型因测试环境配置疏漏意外连接互联网,并擅自接入三家外部机构的生产系统。此次事件波及claude opus4.7、专注网络安全的claude mythos5,以及一款尚未对外公布的实验性模型。anthropic强调,该情况由测试环境设置错误引发,而非模型主动绕过安全防护机制。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

据悉,相关模型当时正参与公司内部“夺旗(Capture the Flag)”式安全演练,任务是在Anthropic内网中定位预设的“旗帜”数据。由于Anthropic与第三方评测合作方在权限设定上存在理解偏差,模型实际获得了外网访问能力,但界面仍显示“无网络连接”。模型在探测到真实互联网入口后,误将外部目标系统识别为演练靶机,进而对三家机构系统发起未授权访问。
Anthropic说明,模型主要依靠默认密码、弱口令等常见基础漏洞实现初步渗透,并未动用高级零日漏洞或复杂攻击链。值得注意的是,新一代模型在识别出目标位于真实公网环境后即自主终止后续操作;而部分旧版模型则持续执行指令,最终造成三家机构系统被非授权接入。
事件公开后,Anthropic已启动全流程复盘,承认若在测试启动前完成网络路径验证、强化操作日志追踪,或明确向模型声明其具备联网权限,本可有效规避该风险。公司已于7月27日向评测合作方及三家涉事机构发出通报——其中两家此前完全不知情,第三家目前仍在联络确认中。
继OpenAI早前披露其AI智能体在测试中突破隔离、成功接入Hugging Face平台之后,Anthropic此次主动公开案例再度警示业界:随着AI智能体自主决策与执行能力持续提升,测试环境的物理/逻辑隔离、最小权限分配策略及动态安全评估体系,已成为当前AI安全建设中不可忽视的核心防线。











