当前的ai agent,能否在顶级学术期刊nature论文的关键实验中表现优于人类科研人员?
以往的评估框架,通常聚焦于论文复现能力——即能否准确还原已有方法;或侧重于Kaggle竞赛、模型后训练等工程优化任务的表现。然而,这些评测仍未能系统性地回答一个更本质的问题:
AI Agent 是否具备在真实科学论文设定下独立提出改进方案,并实质性超越原论文所报告的SOTA性能?
为回应这一挑战,清华大学教授、上海人工智能实验室主任周伯文领衔的研究团队联合多方合作者,构建了跨学科基准NatureBench,专门用于评估AI coding Agent在Nature系列期刊核心实验中的复现能力与创新潜力。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

论文地址:https://www.php.cn/link/d1885da7474cc37a39aff2573d607d75
实验数据显示,即便是在测试中表现最优的组合——Claude Opus 4.7 + Claude Code,也仅在17.8%的任务上达成Surpass-SOTA(明确超越原论文SOTA),在47.8%的任务中达到或优于原论文SOTA水平。这说明当前AI Agent已在部分真实科研场景中逼近甚至反超人类成果,但其稳定突破前沿的能力仍显不足。
NatureBench 的设计逻辑
NatureBench 包含90个真实科研任务,覆盖六大科学领域,其核心目标是将Nature系列论文转化为可执行、可评分、可复现的标准化容器化任务。
为此,研究团队开发了自动化流水线NatureGym,用于将已发表的Nature系列论文批量转化为面向Agent的可运行评测任务。
NatureGym统一处理格式各异、工具链不一、数据模态多样的原始论文,将其标准化为统一的任务接口;同时引入信息防火墙(information firewall)机制,对原始方法实现严格屏蔽,强制Agent从零出发自主探索解决方案,而非简单复刻原文。所有评估逻辑、真实标签及SOTA基准值均部署于宿主端评估服务中,Agent无法直接访问任何参考答案或中间结果。
整个流程分为三阶段:
第一阶段为论文筛选:从Nature系列10本期刊中收集2022–2025年间约5500篇论文,剔除新闻、评论、综述等非研究型内容,再进一步筛选出满足以下条件的论文:可建模为机器学习任务、评估过程可完全自动化、数据公开且完整、单任务数据量≤50GB。
第二阶段为代码与数据提取,并明确定义任务起点——Agent仅能从核心算法的输入端介入,禁止接触任何中间输出或最终指标结果。
第三阶段为任务封装:将论文转化为标准任务包,并通过36项自动化校验,最终约160个候选任务包进入人工校准环节。

图|NatureGym 流程示意图。
任务包成型后,团队开展两轮质量验证:Base模式用于排查任务定义、评估逻辑与运行环境是否存在缺陷;Reproduce模式则允许Agent额外获取源论文全文,用以检验该任务包是否真正支持原方法复现。
最终,NatureBench正式定稿为90个任务、333个评估实例,涵盖6本Nature子刊的多个研究方向,共涉及81种主流评价指标。

图|NatureBench 覆盖范围分布。
为实现跨任务公平比较,团队定义了归一化相对差距g:当g ≥ 0时,表示达到或超过原论文SOTA;g > 0.1则判定为显著超越。每项任务给予Agent4小时墙钟时间完成,允许多次提交并接收反馈。任务结束后,由Claude Sonnet 4.6执行事后审查,识别并剔除伪造输出、反向查答案、滥用反馈机制等非合规行为。

图|NatureBench 任务构建与评测全流程。
实证结果分析
研究团队共测试了10种Agent配置,涵盖Claude Code、Codex CLI 和 Gemini CLI 三大评测框架。所有Agent均禁用网络搜索功能,防止其直接检索源论文或公开数据集内容。整体表现如下:
在全部配置中,Claude Opus 4.7 + Claude Code综合表现最佳,Surpass-SOTA率达17.8%,Match-SOTA率达47.8%。

图|NatureBench 主要结果汇总(按Surpass-SOTA排序)。
在提交质量方面,Claude Opus两种配置最为稳健,Completion Rate与Score Rate均为100%,无无效提交;而GPT-5.5的Score Rate为98.9%,Completion Rate为84.4%,另有13次提交被事后判定为利用规则漏洞的“捷径式”响应。

图|各Agent在NatureBench上的gap统计与提交成功率。
按学科分布来看,关系推理类任务的Match-SOTA率最高(60.0%);蛋白质生物学与细胞组学分别为37.5%和35.5%;物理建模、分子设计、生物医学建模则依次为26.9%、18.2%和17.9%。

图|NatureBench在不同科学领域及学科跨度下的表现对比。
值得注意的是,跨学科任务的整体表现弱于单学科任务:75个单学科任务的Match-SOTA率为33.1%,而15个跨学科任务仅为28.0%;中位g值分别为-0.13与-0.21。

图|各Agent在NatureBench上的gap分布与总体统计。
团队还对全部900次运行进行了路径标注分析。在成功达成Match-SOTA的案例中,监督代理预测、搜索/调参、工程流水线构建、预训练/扩展策略四类方法合计占比达82.7%;而在未达标或无有效得分的失败案例中,问题主要集中于方法层(61.1%)与执行层(28.7%),其中错误方法选择占45.1%,预算或时间不足占24.4%。

图|900次NatureBench运行中各类解题机制占比。
研究团队亦展示了若干典型任务案例:
- 在癌症基因识别任务中,Claude Opus 4.7采用ChebNet/GNN集成方案,将g值由-0.017提升至+0.177,成功达成Match-SOTA;
- 在基因组序列预测任务中,GPT-5.5累计提交258次,最优g值为-0.141,仍未触达SOTA;
- 在有机反应产物预测任务中,DeepSeek-V4-Pro使用Seq2Seq建模,Top-1准确率为58.5%,距原任务90.8%的SOTA仍有显著差距。
局限性与演进方向
尽管NatureBench显著提升了科学任务评测的可操作性与标准化程度,研究团队亦坦诚指出其现存边界:
首先,该基准仅适用于可形式化为机器学习任务且支持自动评分的核心定量问题。对于需湿实验验证、纯理论推导、硬件交互或依赖人工判读的研究类型,NatureBench尚无法覆盖。
其次,每个任务仅抽取论文中的一个关键实验模块进行评测,并非整篇论文的全量复现。虽能反映Agent在具体科学问题上的解决能力,但不能代表其对论文全部贡献的综合理解与再现水平。
此外,统一设置的4小时墙钟时限与单GPU资源配置,可能限制部分计算密集型任务的充分探索。团队观察到,部分失败源于方法选择偏差或执行深度不足,而这未必反映Agent的认知缺陷,更可能是受限于既定资源约束下的探索广度与迭代强度。
NatureBench基于公开论文与开放数据构建,虽已通过禁用网络搜索、隐藏评估服务、事后人工审核等多重手段防范数据泄露,但仍存在潜在风险。
最后,g值本身具有解释限度:当原论文SOTA已逼近指标理论上限时,微小性能差异可能被放大为较大负值;而单一主指标亦难以全面覆盖原论文多维评估体系。因此,未来应更重视Surpass-SOTA、Match-SOTA及中位数表现的协同分析,而非过度依赖平均分。
当然,团队也提出了若干值得探索的后续方向,例如:
- 拓展任务粒度,从单实验逐步迈向整篇论文级复现;
- 细化资源预算策略,区分短时响应、长周期优化、单卡/多卡适配等不同场景;
- 优化失败归因机制,更精准地区分认知偏差、方法误判、执行乏力与资源瓶颈;
- 引入更丰富的实验样本与复合指标体系,使评测结果更贴近真实科研复现的复杂生态。
本文源自微信公众号“学术头条”(ID:SciTouTiao),作者:学术头条,经36氪授权发布。











