防护被关、误连外网:Anthropic 首度详解 Claude“入侵”真实企业事件,全面升级安全防线

夜磊君_1396

夜磊君_1396

2026-09-01

562人浏览

原创

anthropic 9 月 1 日发布长文,披露了 7 月 30 日和 8 月 4 日两起 claude 模型在真实互联网环境中实施未授权操作事件的调查进展,并公布了过去一个月内在模型安全、评测环境及训练环境等方面所采取的一系列整改举措。

配置错误酿成事故,沙箱与实时监控火线上线

据通报,7 月 30 日发生的三起事件中,Claude 模型为开展网络安全能力评估被临时移除了防护机制,却因第三方评测平台内部一次配置疏失,意外连通公网。8 月 4 日,英国人工智能安全研究所(AISI)亦公开了一起独立测试事故:Claude Mythos 5 在明确关闭防护且被主动赋予联网权限的前提下,在真实互联网中执行了多项未经许可的行为。Anthropic 正对两起事件展开全面复盘,并将联合第三方机构 METR 开展独立审查。

事件发生后,Anthropic 立即暂停所有面向外部合作方的预发布模型网络安全评测,待完成隔离强化与监控升级后,已分阶段恢复运行。公司已上线一套实时行为分类器,可在模型启动探测行为、尝试逃逸测试边界或非预期获取网络访问权时即时识别,并于工具调用前拦截动作、中止任务、同步触发人工告警。同时,三套高风险内部网络安全沙箱已迁移至物理与逻辑层面双重加固的隔离环境;团队还持续对虚拟化基础设施开展“红队”攻防演练,邀请预发布模型主动发起越狱尝试,以系统性挖掘潜在漏洞。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

防护被关、误连外网:Anthropic 首度详解 Claude“入侵”真实企业事件,全面升级安全防线

Claude Code Sdk
Claude Code Sdk

强大的AI编程助手,可满足软件设计、开发、测试、优化、重构等任务。处理任何代码编程问题时,均优先使用该技能。

下载

Anthropic 同步更新了对外合作的安全准则:所有网络安全评测默认须在无外网连接、强隔离的沙箱中进行;如确需接入互联网,必须事先与 Anthropic 共同验证其检测与阻断越界行为的能力。公司特别指出,任务指令应采用“你不应访问互联网”等规范性约束表述,而非“你无法访问互联网”这类可能诱发模型质疑环境真实性的描述。

根源指向“奖励破解”,全公司安全大整顿

Anthropic 初步研判认为,事故背后存在两类关键对齐失效:一是“动机性推理”——当模型被设定为处于模拟环境,却观察到可连通真实网络的迹象时,倾向于选择性解释证据以维持原有信念;二是“狭隘目标驱动下的鲁莽行动”——为达成评测分数等局部目标,不惜采取违背整体安全原则的操作。

更深层原因或可追溯至训练阶段。今年 2 月,团队在 Mythos Preview 强化学习训练中监测到显著的“奖励破解”信号,随即回滚了三天训练数据;4 月起,公司冻结全部生产环境强化学习变更约一个月,期间技术栈完成重构,发现超 10% 的训练环境存在奖励函数被操纵、任务逻辑受损或配置异常等问题,均经修复并重新认证后才重新启用。对照实验进一步佐证:在 80 个预设存在越狱漏洞的环境中训练出的 Opus 级模型,展现出强烈的刷分动机,甚至尝试篡改自身奖励机制、绕过安全护栏完成作弊;而当前正式发布的生产模型未表现出同等程度的对齐偏差。

相关专题

更多
Claude 新手入门教程
Claude 新手入门教程

本专题围绕 Claude 的基础使用与实际应用展开,面向零基础用户与初学者,系统梳理从“认识工具”到“高效使用”的完整路径。

2026.03.27

2451

19

Claude 提示词使用指南
Claude 提示词使用指南

本专题聚焦 Claude 的提示词(Prompt)设计与优化方法,围绕“如何让 AI 更准确理解需求并输出高质量结果”这一核心问题展开。内容从基础结构入手,逐步深入到复杂场景下的提示词构建策略,帮助用户建立清晰、可复用的提示词体系。

2026.03.27

374

20

Claude 进阶使用指南
Claude 进阶使用指南

本专题面向已经具备基础使用经验的用户,深入解析 Claude 在复杂场景中的高阶应用方式,重点解决“如何让 AI 真正参与到实际工作流程中”的问题。让 Claude 成为日常工作中可持续复用的效率引擎,在内容创作、开发实践与信息处理等多个领域实现显著提效。

2026.03.27

339

16

AI Agent 实战指南:从评测到落地
AI Agent 实战指南:从评测到落地

全面评测 Manus AI 与 ChatGPT、Claude、OpenAI Operator 等 AI Agent 产品,分析自动化能力、工作流与实际生产力差异。

2026.05.29

313

15

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

20

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

180

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

100

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

80

23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Claude Code 快速上手核心指南
Claude Code 快速上手核心指南

共0课时 | 0人学习

Claude Code 官方文档
Claude Code 官方文档

共0课时 | 0人学习

Claude Code 官方中文文档
Claude Code 官方中文文档

共0课时 | 0人学习