
一句话看懂:一项针对2021至2026年ArXiv论文的检测研究发现,当前约32%的新提交论文正文被判定为像AI所写,计算机科学领域比例高达65%,而数学领域仅0.7%。这项研究通过0.4%极低误报率的校准设计,避免了常见AI检测研究的缺陷。
事件核心:发生了什么
研究人员从ArXiv抽取了12,750篇论文,覆盖计算机科学、定量生物学、电子工程系统、经济学与金融、应用物理、统计、凝聚态物理、高能物理、天体物理和数学十个领域。他们使用一款专门针对学术写作校准的AI检测器,将误报率锚定在0.4%(即GPT出现前的论文仅有0.4%会被误判),在该阈值下检测器能正确识别85%的AI学术文本。
结果显示:2021至2022年,论文被判定为AI写的比例始终稳定在0.4%;2023年初ChatGPT出现后迅速爬升,并在2026年初达到约39%的峰值,最近一个完整季度平均约32%。分领域看,过去12个月数据中计算机科学最高(65%),数学最低(0.7%)。研究还指出,数学领域低得分可能并非因为人类作者多,而是因为其论文以公式和定理证明为主,检测器在非连续散文文本中不灵敏。
为什么重要
这项研究为理解AI对学术写作的实际渗透提供了迄今最严谨的量化证据。不同于许多空泛的“N%内容由AI生成”类报告,本研究通过预设极低误报率并采用GPT前论文作为天然对照组,排除了检测器自身偏差。结果揭示了AI在学术文本生产中已占主流——尤其在计算机科学领域,超过六成新论文正文被推测为AI辅助撰写。这直接影响同行评审的可信度、学术论文的原创性判定标准,以及AI作为学术“协作作者”的规范性讨论。同时,数学、物理等领域的低检测率提示:不同文体/学科下检测器的盲区可能导致实际AI使用率被严重低估。
对用户/开发者/创作者的影响
学术研究者:如果超过30%的新论文疑似AI撰写,在阅读文献时需要加倍警惕事实错误、幻觉引用或逻辑跳跃,尤其计算机科学和量化生物学领域。写作时也应明确标注AI辅助范围,避免被检测器误判为AI全文生成而影响投稿。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
学术编辑与审稿人:需要重新审视线上的AI检测工具在实际场景下的误报率和盲区。数学、理论物理等领域的低检测率并不代表低AI使用率,盲目依赖单一检测指标可能导致不公正退稿。
AI工具开发者:本研究的检测方法(基于全文而非摘要)和校准思路(以预LLM文本为锚点)可以作为评估自身检测产品效果的参照基准。不同学科语料的分布差异也意味着通用AI文本检测器需要针对具体领域做微调优化。
值得关注的后续
- ArXiv是否会像某些出版商(如Elsevier、Springer Nature)一样,强制要求作者声明是否使用AI工具,以及是否引入官方AI文本检测环节。
- 计算机科学领域65%的高比例,是否会促使ICML、NeurIPS等顶会调整审稿规则或增设AI使用披露要求。
- 本研究公开的检测器校准方法是否会被其他学术机构采用,形成更广泛的跨领域AI写作可重复性评测标准。


