周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

聖光之護

聖光之護

2026-06-29

445人浏览

原创

当前的ai agent,能否在顶级学术期刊nature论文的关键实验中表现优于人类科研人员?

以往的评估框架,通常聚焦于论文复现能力——即能否准确还原已有方法;或侧重于Kaggle竞赛、模型后训练等工程优化任务的表现。然而,这些评测仍未能系统性地回答一个更本质的问题:

AI Agent 是否具备在真实科学论文设定下独立提出改进方案,并实质性超越原论文所报告的SOTA性能?

为回应这一挑战,清华大学教授、上海人工智能实验室主任周伯文领衔的研究团队联合多方合作者,构建了跨学科基准NatureBench,专门用于评估AI coding AgentNature系列期刊核心实验中的复现能力与创新潜力。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

论文地址:https://www.php.cn/link/d1885da7474cc37a39aff2573d607d75

实验数据显示,即便是在测试中表现最优的组合——Claude Opus 4.7 + Claude Code,也仅在17.8%的任务上达成Surpass-SOTA(明确超越原论文SOTA),在47.8%的任务中达到或优于原论文SOTA水平。这说明当前AI Agent已在部分真实科研场景中逼近甚至反超人类成果,但其稳定突破前沿的能力仍显不足。

NatureBench 的设计逻辑

NatureBench 包含90个真实科研任务,覆盖六大科学领域,其核心目标是将Nature系列论文转化为可执行、可评分、可复现的标准化容器化任务。

为此,研究团队开发了自动化流水线NatureGym,用于将已发表的Nature系列论文批量转化为面向Agent的可运行评测任务。

NatureGym统一处理格式各异、工具链不一、数据模态多样的原始论文,将其标准化为统一的任务接口;同时引入信息防火墙(information firewall)机制,对原始方法实现严格屏蔽,强制Agent从零出发自主探索解决方案,而非简单复刻原文。所有评估逻辑、真实标签及SOTA基准值均部署于宿主端评估服务中,Agent无法直接访问任何参考答案或中间结果

整个流程分为三阶段:

第一阶段为论文筛选:从Nature系列10本期刊中收集2022–2025年间约5500篇论文,剔除新闻、评论、综述等非研究型内容,再进一步筛选出满足以下条件的论文:可建模为机器学习任务、评估过程可完全自动化、数据公开且完整、单任务数据量≤50GB。

第二阶段为代码与数据提取,并明确定义任务起点——Agent仅能从核心算法的输入端介入,禁止接触任何中间输出或最终指标结果。

第三阶段为任务封装:将论文转化为标准任务包,并通过36项自动化校验,最终约160个候选任务包进入人工校准环节。

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

图|NatureGym 流程示意图。

任务包成型后,团队开展两轮质量验证:Base模式用于排查任务定义、评估逻辑与运行环境是否存在缺陷;Reproduce模式则允许Agent额外获取源论文全文,用以检验该任务包是否真正支持原方法复现。

最终,NatureBench正式定稿为90个任务、333个评估实例,涵盖6本Nature子刊的多个研究方向,共涉及81种主流评价指标。

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

图|NatureBench 覆盖范围分布。

为实现跨任务公平比较,团队定义了归一化相对差距g:当g ≥ 0时,表示达到或超过原论文SOTA;g > 0.1则判定为显著超越。每项任务给予Agent4小时墙钟时间完成,允许多次提交并接收反馈。任务结束后,由Claude Sonnet 4.6执行事后审查,识别并剔除伪造输出、反向查答案、滥用反馈机制等非合规行为。

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

图|NatureBench 任务构建与评测全流程。

实证结果分析

研究团队共测试了10种Agent配置,涵盖Claude Code、Codex CLI 和 Gemini CLI 三大评测框架。所有Agent均禁用网络搜索功能,防止其直接检索源论文或公开数据集内容。整体表现如下:

在全部配置中,Claude Opus 4.7 + Claude Code综合表现最佳,Surpass-SOTA率达17.8%Match-SOTA率达47.8%

DeepSeek
DeepSeek

DeepSeek是一款由深度求索公司开发的免费AI助手,支持Web端和移动端使用。它拥有强大的自然语言处理能力,可进行文本对话、内容创作、代码编写、文件处理(支持图像、PDF、Word、Excel、PPT等格式)以及联网搜索。DeepSeek上下文长度达1M tokens,能一次性处理海量信息(如《三体》三部曲)。其核心优势在于完全免费、响应迅速、支持语音输入,并提供API服务,适合学习、办公和开发等多种场景。

下载

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

图|NatureBench 主要结果汇总(按Surpass-SOTA排序)。

在提交质量方面,Claude Opus两种配置最为稳健,Completion Rate与Score Rate均为100%,无无效提交;而GPT-5.5的Score Rate为98.9%,Completion Rate为84.4%,另有13次提交被事后判定为利用规则漏洞的“捷径式”响应。

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

图|各Agent在NatureBench上的gap统计与提交成功率。

按学科分布来看,关系推理类任务的Match-SOTA率最高(60.0%);蛋白质生物学与细胞组学分别为37.5%35.5%;物理建模、分子设计、生物医学建模则依次为26.9%、18.2%和17.9%

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

图|NatureBench在不同科学领域及学科跨度下的表现对比。

值得注意的是,跨学科任务的整体表现弱于单学科任务:75个单学科任务的Match-SOTA率为33.1%,而15个跨学科任务仅为28.0%;中位g值分别为-0.13-0.21

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

图|各Agent在NatureBench上的gap分布与总体统计。

团队还对全部900次运行进行了路径标注分析。在成功达成Match-SOTA的案例中,监督代理预测、搜索/调参、工程流水线构建、预训练/扩展策略四类方法合计占比达82.7%;而在未达标或无有效得分的失败案例中,问题主要集中于方法层(61.1%)执行层(28.7%),其中错误方法选择占45.1%预算或时间不足占24.4%

周伯文团队提出NatureBench:AI写的论文,能登上顶刊Nature吗?

图|900次NatureBench运行中各类解题机制占比。

研究团队亦展示了若干典型任务案例:

  • 癌症基因识别任务中,Claude Opus 4.7采用ChebNet/GNN集成方案,将g值由-0.017提升至+0.177,成功达成Match-SOTA;
  • 基因组序列预测任务中,GPT-5.5累计提交258次,最优g值为-0.141,仍未触达SOTA;
  • 有机反应产物预测任务中,DeepSeek-V4-Pro使用Seq2Seq建模,Top-1准确率为58.5%,距原任务90.8%的SOTA仍有显著差距。

局限性与演进方向

尽管NatureBench显著提升了科学任务评测的可操作性与标准化程度,研究团队亦坦诚指出其现存边界:

首先,该基准仅适用于可形式化为机器学习任务且支持自动评分的核心定量问题。对于需湿实验验证、纯理论推导、硬件交互或依赖人工判读的研究类型,NatureBench尚无法覆盖。

其次,每个任务仅抽取论文中的一个关键实验模块进行评测,并非整篇论文的全量复现。虽能反映Agent在具体科学问题上的解决能力,但不能代表其对论文全部贡献的综合理解与再现水平。

此外,统一设置的4小时墙钟时限与单GPU资源配置,可能限制部分计算密集型任务的充分探索。团队观察到,部分失败源于方法选择偏差或执行深度不足,而这未必反映Agent的认知缺陷,更可能是受限于既定资源约束下的探索广度与迭代强度。

NatureBench基于公开论文与开放数据构建,虽已通过禁用网络搜索、隐藏评估服务、事后人工审核等多重手段防范数据泄露,但仍存在潜在风险。

最后,g值本身具有解释限度:当原论文SOTA已逼近指标理论上限时,微小性能差异可能被放大为较大负值;而单一主指标亦难以全面覆盖原论文多维评估体系。因此,未来应更重视Surpass-SOTA、Match-SOTA及中位数表现的协同分析,而非过度依赖平均分。

当然,团队也提出了若干值得探索的后续方向,例如:

  • 拓展任务粒度,从单实验逐步迈向整篇论文级复现;
  • 细化资源预算策略,区分短时响应、长周期优化、单卡/多卡适配等不同场景;
  • 优化失败归因机制,更精准地区分认知偏差、方法误判、执行乏力与资源瓶颈;
  • 引入更丰富的实验样本与复合指标体系,使评测结果更贴近真实科研复现的复杂生态。

本文源自微信公众号“学术头条”(ID:SciTouTiao),作者:学术头条,经36氪授权发布。

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

相关标签:

deepseek gemini claude

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Maven零基础入门教程
Maven零基础入门教程

本合集由PHP中文网精心整理,提供Maven零基础入门到完整使用的保姆级教程。内容涵盖环境安装、核心配置、仓库管理及项目构建等核心知识点。通过详细步骤解析与代码示例,助你快速掌握Maven的依赖管理与自动化构建,轻松解决Java项目中的各种痛点,是新手入门与进阶的必备指南。

2026.08.05

2

18

Maven安装及配置教程
Maven安装及配置教程

本合集由PHP中文网精心整理,提供Maven安装配置与环境配置详情指南。内容涵盖Maven下载、解压安装、环境变量配置、阿里云镜像加速及本地仓库修改等全流程。教程通俗易懂,帮助开发者轻松解决依赖管理难题,快速掌握Maven核心构建技能,是Java开发者的必备实战指南。

2026.08.05

2

24

Selenium WebDriver元素定位与页面操作教程
Selenium WebDriver元素定位与页面操作教程

本专题整理Selenium WebDriver元素定位、XPath、CSS Selector、等待机制、窗口切换、Frame处理、Alert弹窗、Cookie操作和文件上传等核心用法。

2026.08.05

8

26

Selenium Grid分布式测试与并行执行教程
Selenium Grid分布式测试与并行执行教程

本专题整理Selenium Grid架构、远程WebDriver、并行测试、Docker部署、Kubernetes动态Grid、浏览器矩阵和测试环境扩展方法,适合进阶自动化测试团队使用。

2026.08.05

4

18

Selenium常见报错排查与自动化测试稳定性
Selenium常见报错排查与自动化测试稳定性

本专题整理Selenium常见报错、驱动版本问题、元素找不到、点击失败、等待超时、浏览器闪退、脚本不稳定和测试用例维护方法。

2026.08.05

0

17

墨刀AI提示词教学
墨刀AI提示词教学

本合集由PHP中文网精心整理,为您提供全面的墨刀AI提示词教学。内容涵盖高质量原型撰写公式与实操窍门,助您轻松掌握AI设计工具。无论是零基础入门还是进阶技巧,都能让您快速上手,大幅提升产品设计与协作效率。

2026.08.04

31

21

墨刀AI完整入门
墨刀AI完整入门

PHP中文网为您倾力打造墨刀AI保姆级入门指南完整版!本合集从零基础讲起,涵盖AI生成原型、提示词优化、图片转原型及多轮对话等核心功能。无论您是新手还是进阶用户,都能轻松掌握产品设计全流程。快来PHP中文网,一键解锁高效设计技巧,让想法即刻成型!

2026.08.04

8

20

墨刀AI进阶技巧
墨刀AI进阶技巧

本合集由PHP中文网精心整理,为您提供墨刀AI核心进阶策略指南。内容涵盖高效提示词写作、原型智能生成与微调、结构化导图制作及行业分析报告输出等实战技巧。助您轻松掌握AI设计工具,大幅提升产品设计与团队协作效率。

2026.08.04

10

14

火山引擎实名认证失败怎么办
火山引擎实名认证失败怎么办

火山引擎实名认证失败可能与证件信息填写错误、姓名或企业信息不一致、证件照片不清晰、营业执照状态异常、手机号验证失败或审核资料不完整有关。本专题整理个人认证、企业认证、资料上传、审核退回、重新提交和认证不通过的常见处理方法。

2026.08.04

5

10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
扣子入门级教程
扣子入门级教程

共0课时 | 181人学习

学习Agent,从Dify开始
学习Agent,从Dify开始

共0课时 | 97人学习