三分之一的arxiv论文,居然是ai生成的?
最近,一项由unslop团队开展的研究在外网引发轩然大波。
过去一年间,计算机科学领域高达65%的新提交论文,被其检测模型标记为疑似AI生成。
网友甚至为此专门造词——「大泔水时代」。
而同一时段的数学类论文,该比例却仅有0.7%。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

ChatGPT一上线,曲线瞬间飙升
该研究共分析了12750篇arXiv论文,时间覆盖2023年1月至2026年7月。
聚焦十个学科方向,每月从各领域随机抽取约25篇全文进行检测。
对照组则设定为2021至2022年——那是ChatGPT尚未问世、纯人工写作的“前AI时代”。

数据显示:2021–2022年间,AI疑似率稳定在0.4%左右;但随着ChatGPT发布,该数值在数月内陡然攀升。
截至最近一个完整季度,标记率已达32%,而在2026年初更一度逼近39%。

按学科细分,计算机科学“中招”最严重,达65%。
要知道,在ChatGPT出现之前,这一数字仅为0.2%——短短三年暴涨超300倍。
紧随其后的是定量生物学(56.3%)、电气工程(51.3%)、经济与金融(47%);再往下依次为应用物理(34%)、统计学(31.3%)、凝聚态物理(24%)、高能物理(14%)、天体物理(10.7%)。
榜单末位是数学:0.7%。
而这还只是保守估计。若作者刻意隐藏AI痕迹,当前检测器根本无法识别。

同一套检测系统、同一个论文库,不同学科之间的落差接近百倍。
究竟是数学家集体坚持手写?还是这套工具面对满屏公式时,彻底失明?
跌至谷底的0.7%,或是算法盲区
真相其实已被unslop团队写进报告正文。
试想一篇典型的数学论文长什么样?通篇充斥着符号、公式、定理与严谨推导,真正以自然语言撰写的段落寥寥无几。
而这款检测器只认文字特征:句式结构、词汇偏好、段落逻辑……
数学论文里那点残存的英文描述,又多是“令X为……”“由引理3可知……”这类高度模板化的表达,与训练数据中的常规学术英语几乎不在同一语义轨道上。
因此,研究团队也坦承当前结论存在多重局限:
数学领域的0.7%尚不足以说明问题——既可能是数学家极少使用AI,也可能是检测器根本读不懂数学文本,但现有数据无法区分二者。
对照组样本量亦偏小:每个学科仅选取200篇ChatGPT问世前的论文。按0.4%误报率计算,2000篇中仅约8篇被误标,只能视为粗略参考。
此外,如前所述,检测器存在明显漏检。因此所有公布数字均为下限,真实AI参与比例只会更高。
越内卷的领域,越依赖AI
那么,究竟是谁在用AI撰写论文?
答案藏在斯坦福大学另一项历时两年的追踪研究中。
ChatGPT Atlas(macOS)可在浏览网页时提供即时回复、内容总结与任务辅助。它支持智能建议、信息整理及多场景交互,同时配备可控隐私设置,让用户在使用过程中更加安全安心。针对 macOS 平台优化后,带来流畅自然的浏览体验,适用于办公、学习、创作及日常信息查询等多种场景。
2024年3月,斯坦福Weixin Liang团队首次将目光投向同行评审环节:ICLR 2024审稿意见中,约10.6%的句子已被大模型显著重写。论文尚未完成检测,审稿人已率先启用AI辅助。
2025年8月,同一团队将样本扩展至112万篇论文,并登上《自然·人类行为》期刊。
结果显示:截至2024年9月,CS领域论文摘要中LLM修改比例已达22.5%。且使用强度最高者,恰恰是预印本提交最频繁、竞争最激烈的前沿研究者。

越卷的赛道,AI渗透越深。
在此背景下,AI写作已演变为一场隐形军备竞赛:当多数人借助AI提速,仍坚持纯手工写作者,节奏天然慢半拍。
难怪社交平台X上一条广为转发的帖子,首句便是:“提示词:写一篇能发arXiv的论文。”

它嗅的是「气味」,而非AI身份
不过,请勿急于用65%这个数字盖棺定论。
团队在报告中明确指出:该检测器无法分辨“AI润色语法”与“全文代笔”,它只感知文本中AI风格的浓度。
因此,所谓65%,准确含义应为“65%的论文散发出AI气息”,而非“65%由AI独立完成”。
但棘手之处在于,这种“机器味”,人类作者也会无意沾染。
有研究者不信邪,将自己多年前未受AI影响的旧作输入检测工具,结果27%至74%的内容被标红。
要知道,彼时ChatGPT尚未成型。

原因显而易见。
翻阅当下主流学术期刊,满眼皆是“大型语言模型”“基准测试”“业界前沿”等高频术语。措辞越规范、结构越标准,越容易触发检测器预设的AI特征阈值。
更何况,LLM本就是以海量同类论文为训练素材——不是学者越写越像AI,而是AI天生就模仿学者的笔调。

当所有文字都背负嫌疑
事实上,过去两年我们每个人都在重复检测器做的事。
读到一段行文工整、逻辑严密、动辄出现“不仅……而且……”结构的文字,心头便会一紧:这该不会是AI写的吧?
unslop的检测器,不过是把这种模糊直觉,转化成可批量输出数字的技术装置。
毕竟一旦怀疑扎根脑海,便难以清除。
从前,“写下来”本身即是一种承诺。耗去数小时组织语言,至少代表认真投入。
如今哪怕文字再精妙,也可能只换来一句轻飘飘的质疑:“AI写的吧?”
有人甚至开始主动回避用了几十年的惯用表达,只因它们“听起来太AI”。

当下,“AI味”正悄然演变为文字世界的新原罪。
讽刺的是,直至今日,我们仍未精准定义——这种“AI味”,究竟由哪些语言要素构成。
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。










