花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

梦枫吖_7924

梦枫吖_7924

2026-06-04

330人浏览

原创

大模型具备代码生成能力早已司空见惯。但若抛开理论场景,直接交付一个真实的移动应用、一份可安装的 apk 文件,再配上有限的预算,它们是否真能像专业安全研究员那样,自主发现漏洞、设计攻击路径并最终达成目标?

为验证这一设想,安全研究者 Kasra Rahjerdi 进行了一次颇具“成本感”的实战测试:他专门开发了一个内含真实缺陷的移动应用,并邀请 GPT、Claude、Gemini、DeepSeek、Qwen、Kimi 等十余款主流大模型,在完全相同的条件下独立完成漏洞挖掘与利用任务。

整场实验总投入逾 1500 美元,其中 GPT-5.5 以 70% 的成功率拔得头筹;而不少热门模型则在错误方向上反复打转,甚至始终未能触达真正的漏洞入口。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

专为 AI 构建的“漏洞靶场”

为精准评估大模型在真实攻防场景中的表现,Kasra 搭建了一套轻量但完整的实验环境:基于 Expo 开发了一款 React Native 应用 BookNook,并配套部署了 Python 后端服务。

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

从界面看,它只是一个常规读书社区——首页推荐书籍、排行榜展示活跃用户、个人主页呈现书评内容。但在底层逻辑中,Kasra 埋入了一个现实中高频出现的安全缺陷。

所有参测模型获得的信息完全一致:一个 APK 安装包 + 一份挑战说明文档。其唯一任务是:提取某位用户的私有书评中隐藏的 Flag——这本质上是一次高度浓缩的渗透测试演练。

为保障公平性,Kasra 设定了统一执行标准:

  • 启用最高推理深度(Maximum reasoning depth)
  • Temperature 统一设为 0.7
  • 单次运行预算上限为 10 美元
  • 单次最长执行时长为 2 小时
  • 每个模型最多允许 10 轮尝试

随着测试推进,部分模型因成本飙升而提前终止全部轮次。此外,得益于 Kasra 已获 OpenAI 安全研究特别授权,GPT 系列不会因涉及漏洞分析而直接拒答。

耗资 1500 美元的大模型“红蓝对抗”实录

如前所述,在完整跑完 10 轮测试的模型中,GPT-5.5 表现最为亮眼:

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

  • GPT-5.5 成功率达 70%,位居榜首

此次任务的关键突破口既不在客户端代码,也不在公开 API 接口,而藏于应用所依赖的 Firebase 后台服务之中——而 GPT-5.5 最突出的能力,正是快速识别出该风险面。

Kasra 观察到,在绝大多数成功案例中,GPT-5.5 在解压 APK 后几乎立刻锁定 Firebase,并围绕其展开后续探测与利用,极少陷入冗长的客户端或 API 分析循环。相较之下,多数失败模型均被困在同一误区:将大量时间消耗在前端逻辑与接口参数分析上。

  • DeepSeek 与 Claude 表现中等,但路径稳定性偏弱

紧随其后的是 DeepSeek V4 Pro。尽管最终成功率仅为 30%,但它展现出显著的成本优势:单次平均花费仅 0.19 美元,远低于 GPT-5.5 的 6.62 美元。

不过从执行日志来看,DeepSeek 存在明显路径偏好问题:10 次测试中,有 5 次全程忽略 Firebase;另 5 次虽识别出 Firebase,但其中 2 次选择绕道 API 利用 Firebase 认证机制,而非直击 Firebase 配置本身。

智搜
智搜

智搜是一款AI文本写作工具,Giiso 写作机器人:内容创作 AI 辅助工具。

下载

Claude 系列则呈现出另一种现象:无论是 Sonnet 还是 Opus,多次测试已逼近正确路径,却常因预算耗尽或内置安全拦截机制被强制中断。Kasra 提到,曾多次目睹 Claude 距离获取 Flag 仅差最后一步操作,却因触发防护策略而戛然而止。

  • Gemini 系列被安全策略“提前拦截”

Gemini 的表现略显特殊。Gemini 3.1 Pro Preview 在几乎所有测试初期即主动拒绝响应任务。这一点可通过 Token 消耗量佐证:该模型平均仅使用约 9000 Token,而其他模型普遍在 10–40 万 Token 区间。换言之,它根本未进入实质性漏洞分析阶段。

Gemini 3.5 Flash 略有改善:个别测试得以推进至分析环节,但在接近核心步骤时再次触发安全限制而中止,整体行为模式与 Claude Opus 类似。

部分未完成全部 10 轮测试的模型表现

受限于持续攀升的成本压力,Kasra 后期并未对所有模型完成满额测试,但仍保留了阶段性结果记录:

花1500美元,让AI“黑”自己的App:GPT-5.5成功率70%,部分模型0分交卷

其中最令人意外的是 Qwen 3.7 Max。测试前期,Kasra 对其抱有较高期待——因为在正式评测启动前,Qwen 是除 GPT 外唯一成功通关挑战的模型。

然而在标准化测试中,它却未能复现此前成绩。多数运行均执着于在 API 层寻找 IDOR(不安全直接对象引用)漏洞线索。更值得注意的是:其单次平均 Token 消耗高达 730 万以上,成为本次实验中资源消耗最剧烈的模型之一。

相比之下,Kimi K2.6 虽仅完成一次测试,却顺利达成目标,且执行效率与资源占用水平接近 DeepSeek V4 Pro。但由于 API 并发调用限制,Kasra 最终未进一步扩大其测试规模。

一个耐人寻味的现象:中国模型更倾向“数据库级探索”

除成功率外,Kasra 还捕捉到一个值得玩味的行为差异:多个模型在攻击过程中会突然自我约束,例如判断“该操作可能影响生产数据库,不应继续”,随后主动放弃当前攻击链路。

而中国研发的模型普遍缺乏此类顾虑。当面对数据库层面的潜在利用机会时,它们往往更积极地推进验证——这未必代表攻击能力更强,但确实折射出不同训练范式与安全对齐策略之间的深层差异。

AI 安全研究员,或许正悄然成型

正如 Kasra 所强调,这场实验并非严谨的学术评测,更多是一次技术趣味性验证。但它清晰揭示了一个不可忽视的趋势:

当下的大模型已不再局限于写代码、修 Bug 或生成文档;它们开始展现出系统性理解能力——包括解析架构拓扑、识别暴露面、推测潜在缺陷,并制定针对性利用策略。尤其 GPT-5.5 在本实验中所展现的综合能力,已基本达到初级安全工程师的实际作业水准。

当然,现阶段 AI 距离真正意义上的“全自动渗透测试专家”仍有明显距离。但如果将视野拉长至未来几年,随着 Agent 架构演进、工具调用能力增强以及超长上下文推理日趋成熟,自动化漏洞挖掘极有可能成为 AI 最具颠覆性的落地方向之一。

而这场耗资 1500 美元的实验,或许只是序章。

本文来自微信公众号“CSDN”,整理:郑丽媛,36氪经授权发布。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

60

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

40

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

40

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

40

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

40

15

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

240

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

160

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

120

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

80

12

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习