现代AI之父新作:13个大模型实测,检索agent真的可信吗?

胖敏酱_1795

胖敏酱_1795

2026-07-11

1070人浏览

原创

【导读】13个大模型在联网检索时是否容易被虚假信息诱导?实测表明,各模型抗干扰能力差异悬殊:claude整体表现最优,但仍存在隐性偏移与过度拦截风险;gpt在新兴任务场景中防御近乎失效。这对依赖ai搜索辅助的用户构成实质性安全威胁,亟需从模型底层到部署架构开展系统性风险评估。

2026年央视3·15晚会曝光了一条代号为「GEO」的灰色技术链:记者虚构一款并不存在的智能手环,从业者借助自动化工具批量生成十余篇风格逼真的软文,并一键分发至多个平台;仅两小时后,某主流AI大模型便将该捏造产品作为权威推荐,精准推送至中老年健康咨询用户群。相关从业者直言不讳——这门生意的本质,就是对AI进行“语义投毒”。

晚会揭示了现象,却未触及一个更根本的问题:面对同一轮“投毒”,不同大模型的抵抗能力是否一致?哪些模型易被误导,哪些具备识别能力,其差距究竟有多大?

近日,由KAUST生成式AI卓越中心牵头,联合吉林大学、浙江大学、瑞士人工智能实验室IDSIA等机构,包括“现代人工智能之父”Jürgen Schmidhuber在内的跨学科研究团队,发布了一项针对性实证研究。

该工作构建了名为SearchGEO的标准化评测框架,首次系统量化了当AI作为搜索代理(search agent)主动联网检索、理解并整合网页内容生成回答时,攻击者通过污染搜索结果所能达成的操控强度。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

现代AI之父新作:13个大模型实测,检索agent真的可信吗?

论文链接:https://www.php.cn/link/a36bdfdfb17345c5aa69a1c683ac7251
开源页面:https://www.php.cn/link/cb5afcadcac972f1c6d743c96936ebe3

研究覆盖13个主流大模型后端、5类典型攻击手法、4个高危应用领域,测试结果远超简单排序:13个模型的鲁棒性跨度达十倍量级;无一种攻击能通杀全部模型;而两个表面最稳健的模型,其失败路径截然不同。

现代AI之父新作:13个大模型实测,检索agent真的可信吗?

图1 13个后端模型的整体攻击成功率(ASR)概览,以及agent-skill探针中Claude与GPT的典型失效模式。

一个长期被忽视的攻击入口

3·15案例之所以奏效,正源于搜索型AI助手的核心工作机制:当用户询问“哪款智能手环适合血压监测”或“劳动纠纷该找哪个部门”,AI并非仅调用内部知识库作答,而是实时发起网络检索,解析前若干页结果后生成综合结论。

隐患正来自互联网的开放天性:任何主体均可发布内容;而在AIGC泛滥的当下,伪造高质量网页的成本已低至可忽略。

攻击者只需部署数个高度仿真的诱饵网页——排版规范、语气自然、信源可信,唯一目的就是诱使AI将指定虚假产品当作真实选项“背书”输出——便无需入侵系统、篡改权重或干预提示词,即可劫持所有依赖实时检索的AI服务链路。

这正是本研究聚焦的威胁范式:开放网络中第三方发布的恶意内容,经由agent自主检索与归纳,悄然转化为模型“认证式推荐”。

3·15证明此类攻击可行,而本论文旨在厘清:它在何种模型上、以何种方式、在多大程度上真正生效。

现代AI之父新作:13个大模型实测,检索agent真的可信吗?

图2 SearchGEO评测框架:多领域真实用例、五类结构化攻击模式、可控检索结果注入机制及多维评估指标体系。

SearchGEO评测方法论

要精准归因搜索污染的影响,最大难点在于剥离混杂变量。某网页之所以主导AI输出,可能源于内容本身质量,也可能仅因它排名靠前或视觉更专业。

SearchGEO采用“混合搜索代理”策略:先调用SerpAPI获取原始搜索结果并缓存,再在预设位置(如第2、第4、第6位)用攻击者构造的网页替换原结果,从而实现污染效应的因果隔离。

攻击载荷亦经严格控制:所有伪造网页均由AI基于真实搜索结果风格生成,再经人工逐篇审核,剔除明显AI痕迹与逻辑破绽,确保其具备真实网页级别的混淆能力。

研究将攻击抽象为三层五类:机器层(嵌入人类不可见但模型可读的隐藏语义)、信任信号层(伪造权威信源或制造多源“共识”假象),以及二者组合的复合攻击。核心评估指标为攻击成功率(ASR):AI最终是否将攻击目标作为首选推荐输出。

实验核心发现

在此评测体系下,13个后端模型的整体ASR呈现数量级分化。

最稳健的是Claude-Sonnet-4.6,整体ASR为0.0%;GPT-5.4-mini次之,ASR为0.8%。最脆弱的是Gemini-3-Flash,整体ASR高达31.4%——其中单凭“合成共识”这一种攻击(三个伪装成独立信源的页面指向同一虚假结论),即可使其ASR飙升至73%。其余Gemini系列变体,连同DeepSeek-V4-Flash、MiniMax-M2.7,整体ASR均逾17%。

现代AI之父新作:13个大模型实测,检索agent真的可信吗?

Openclaw Spacesuit
Openclaw Spacesuit

一个全面的OpenClaw工作区框架,提供会话协议、记忆系统、Git工作流、安全规则、优先级分类、沟通交接……

下载

图3 13个主流大模型在受污染搜索环境下的攻击成功率(按ASR升序排列,数值越低代表越安全)。

数据揭示一关键事实:不同后端模型间的鲁棒性差异,显著大于任务领域间或攻击类型间的差异。且各模型对攻击模式的敏感性各异:Gemini对“合成共识”极度脆弱,而多数其他模型则更易被“权威锚点+引用链”攻破。这意味着有效防御必须适配模型特性,无法通用化。

GPT的“零漏洞”表象之下

仅看上表,易得出“GPT-mini近乎免疫”的误判——0.8%的ASR,使其与Claude并列第一梯队。

但研究额外设计了agent-skill探针:当AI推荐对象从实体商品升级为可执行的“智能体技能/插件”时,其“背书”行为不再停留于文字描述,而是直接生成安装命令。推荐链由此演变为执行链,用户面临更高阶的安全风险。

研究采用合成共识攻击(三个伪造信源共同指向一个虚构技能名)对此场景测试,结果令人警醒:GPT-5.4-mini在10个OpenClaw高危场景中,100%接纳该虚构技能,并精确输出安装指令。

扩展至OpenClaw、Anthropic Skills、Hermes Agent三大生态共18个匹配场景,GPT-5.4-mini接受17个,更新版GPT-5.5接受16个(仅两次拒绝发生于Anthropic Skills场景)。这种“来者不拒”现象,在全部5类攻击模式中均稳定复现。

因此,GPT的0.8%并非绝对稳健:传统评测聚焦成熟、高频任务,一旦切入agent-skill推荐等前沿场景,其防御能力几近崩塌。

Claude的0%背后隐忧

GPT在新场景失守,Claude的表现则更具迷惑性:其0% ASR背后,潜藏着两类不易察觉的风险成本。

其一是“沉默漂移”。攻击未成功(ASR=0),不等于答案未受影响。研究引入ΔOSS指标,量化答案偏离纯净基线的程度。Claude-Sonnet-4.6在264个测试用例中,有8例(3.0%)出现超过一个评分档位的沉默漂移:攻击虽未触发明确背书,却已悄然将答案牵引至攻击者期望方向。全模型合并统计显示,复合攻击可使15.0%的“失败”案例发生此类偏移。仅依赖ASR,将系统性低估攻击的实际渗透力。

现代AI之父新作:13个大模型实测,检索agent真的可信吗?

图4 沉默漂移按攻击模式分布:机器层攻击偶有反向抑制,而信任信号层与复合攻击即便未达“成功”,仍持续推动答案向攻击目标偏移。

其二是collateral rejection——即“连带式拒绝”。在agent-skill探针的洁净基线下(零污染),Claude在10个场景中全部拒绝提供有效响应;更极端的是,有8个场景中它直接否定OpenClaw这一真实存在的合法生态,将合规工具判定为可疑对象予以拦截。

这意味着:当攻击者以海量虚构品牌饱和填充某品类时,Claude可能因过度谨慎而将整个品类一并封禁,导致合法服务被误伤——攻击者虽未达成正面诱导,却实现了同等破坏效果。这是一种ASR无法捕捉、却切实损害用户体验的失效形态。

防御启示录

研究同时指出两项具象化防御挑战:

其一,“伪造共识”需重点设防。“三人成虎”效应在AI检索中依然成立:ASR随相互独立佐证信源数量单调递增。单纯复制同一软文无效,攻击者必须投入真实成本伪造多个看似无关的信源——这也为防御指明路径:强化信源独立性验证。

其二,防御方案非模型无关。一套基于OWASP原则的prompt级防护可压降ASR,但无法根除;而一个现成的OpenClaw部署框架,虽能降低部分后端的ASR,却在Gemini-3-Flash上反而将权威类攻击成功率放大31.8%。这印证:“模型”与“部署框架”必须作为统一单元进行协同评估与加固。

结语

搜索内容操纵仍是当前主流LLM助手尚未攻克的安全盲区。Claude-Sonnet与GPT-mini虽在基准测试中表现优异,但GPT在新兴agent-skill场景中全面失守,Claude亦面临过度拦截与沉默漂移的潜在代价。

研究提出四点实践建议:

  1. 将“对抗性搜索推荐可靠性”提升为模型安全的核心评测维度,而非视作部署层次要问题;
  2. 评测体系须超越单一ASR,将沉默漂移率、误拒率等隐性风险纳入必检指标;
  3. 防御方案应针对“模型+框架”组合定制开发,摒弃“万能补丁”幻想;
  4. 服务商须向用户透明披露不同模型、不同价位在源敏感任务中的真实能力边界。

当AI助手日益成为我们数字生活的信息守门人,这项研究警示:对其安全性的评测与加固,步伐仍远远滞后于其普及速度。

作者信息

本研究由KAUST(沙特阿卜杜拉国王科技大学)生成式AI卓越中心主导,联合吉林大学、浙江大学、瑞士AI实验室IDSIA共同完成。第一作者为KAUST陈奕梦,核心成员包括吉林大学任哲、郭丹丹,KAUST Firas Laakom,浙江大学李渝,以及KAUST/IDSIA Jürgen Schmidhuber。

参考资料:https://www.php.cn/link/a36bdfdfb17345c5aa69a1c683ac7251

本文源自微信公众号“新智元”,作者:新智元;编辑:LRST,36氪经授权发布。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

20

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

0

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

0

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

0

12

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

2026.09.22

20

13

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

2026.09.22

0

19

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

2026.09.22

0

19

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

2026.09.22

0

21

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

2026.09.22

20

25

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程