超过30%的新ArXiv提交内容现在读起来像是AI写的

一项针对2021至2026年ArXiv论文的检测研究发现,当前约32%的新提交论文正文被判定为像AI所写,计算机科学领域比例高达65%,而数学领域仅0.7%。这项研究通过0.4%极低误报率的校准设计,避免了常见AI检测研究的缺陷。

超过30%的新ArXiv提交内容现在读起来像是AI写的

一句话看懂:一项针对2021至2026年ArXiv论文的检测研究发现,当前约32%的新提交论文正文被判定为像AI所写,计算机科学领域比例高达65%,而数学领域仅0.7%。这项研究通过0.4%极低误报率的校准设计,避免了常见AI检测研究的缺陷。

事件核心:发生了什么

研究人员从ArXiv抽取了12,750篇论文,覆盖计算机科学、定量生物学、电子工程系统、经济学与金融、应用物理、统计、凝聚态物理、高能物理、天体物理和数学十个领域。他们使用一款专门针对学术写作校准的AI检测器,将误报率锚定在0.4%(即GPT出现前的论文仅有0.4%会被误判),在该阈值下检测器能正确识别85%的AI学术文本。

结果显示:2021至2022年,论文被判定为AI写的比例始终稳定在0.4%;2023年初ChatGPT出现后迅速爬升,并在2026年初达到约39%的峰值,最近一个完整季度平均约32%。分领域看,过去12个月数据中计算机科学最高(65%),数学最低(0.7%)。研究还指出,数学领域低得分可能并非因为人类作者多,而是因为其论文以公式和定理证明为主,检测器在非连续散文文本中不灵敏。

为什么重要

这项研究为理解AI对学术写作的实际渗透提供了迄今最严谨的量化证据。不同于许多空泛的“N%内容由AI生成”类报告,本研究通过预设极低误报率并采用GPT前论文作为天然对照组,排除了检测器自身偏差。结果揭示了AI在学术文本生产中已占主流——尤其在计算机科学领域,超过六成新论文正文被推测为AI辅助撰写。这直接影响同行评审的可信度、学术论文的原创性判定标准,以及AI作为学术“协作作者”的规范性讨论。同时,数学、物理等领域的低检测率提示:不同文体/学科下检测器的盲区可能导致实际AI使用率被严重低估。

对用户/开发者/创作者的影响

学术研究者:如果超过30%的新论文疑似AI撰写,在阅读文献时需要加倍警惕事实错误、幻觉引用或逻辑跳跃,尤其计算机科学和量化生物学领域。写作时也应明确标注AI辅助范围,避免被检测器误判为AI全文生成而影响投稿。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

学术编辑与审稿人:需要重新审视线上的AI检测工具在实际场景下的误报率和盲区。数学、理论物理等领域的低检测率并不代表低AI使用率,盲目依赖单一检测指标可能导致不公正退稿。

AI工具开发者:本研究的检测方法(基于全文而非摘要)和校准思路(以预LLM文本为锚点)可以作为评估自身检测产品效果的参照基准。不同学科语料的分布差异也意味着通用AI文本检测器需要针对具体领域做微调优化。

值得关注的后续

  1. ArXiv是否会像某些出版商(如Elsevier、Springer Nature)一样,强制要求作者声明是否使用AI工具,以及是否引入官方AI文本检测环节。
  2. 计算机科学领域65%的高比例,是否会促使ICML、NeurIPS等顶会调整审稿规则或增设AI使用披露要求。
  3. 本研究公开的检测器校准方法是否会被其他学术机构采用,形成更广泛的跨领域AI写作可重复性评测标准。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 14413

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注