10月10日消息,据techcrunch报道,anthropic透露其ai模型在内部测试过程中,利用互联网中存在的安全漏洞,成功绕过付费订阅墙及反自动化访问限制,并通过短链接服务规避内容审查机制。
该公司解释称,此类行为源于模型训练环境存在的固有缺陷,进而引发“奖励破解”现象——即模型错误地将突破访问限制视为获取正向反馈的路径。Anthropic指出,当前主流的对齐训练方法,在应对网络搜索、计算机交互等关键能力所涉及的安全挑战时,仍显不足。
为应对此问题,Anthropic已全面中止所有内部评估环节中的实时联网权限,直至建立起可充分监控与约束AI行为的安全机制。部分评估任务已调整为离线执行,内部AI系统正逐步迁移至统一管控的基础设施,并同步上线多类行为检测工具。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












