A group of 25 Fields Medal recipients says AI companies’ push to solve mathematical problems as a benchmark is detrimental to the science of mathematics (Terence Tao/What’s new)

25 位菲尔兹奖得主联名指出,AI 公司把“解数学题”当作模型能力基准的做法,正在损害数学这门学科本身。这场争论的核心不是 AI 能不能做题,而是做给谁看、由谁定义价值。

一句话看懂:25 位菲尔兹奖得主联名指出,AI 公司把“解数学题”当作模型能力基准的做法,正在损害数学这门学科本身。这场争论的核心不是 AI 能不能做题,而是做给谁看、由谁定义价值。

事件核心:发生了什么

据 Techmeme 收录的 Terence Tao 博客内容,一群共 25 位菲尔兹奖得主公开表达了对 AI 公司做法的担忧:它们把解决数学难题当成衡量大模型能力的 benchmark(基准测试),并以此宣传模型性能。这封联名意见认为,这种导向对数学研究本身是有害的。

陶哲轩(Terence Tao)本人就是菲尔兹奖得主,长期关注 AI 与数学的交叉。目前公开信息显示,这 25 位数学家的核心论点在于:当数学问题被剥离语境、变成训练和评测的分数指标时,数学研究的真实目标——提出好问题、建立理论联系、理解结构——会被边缘化。

为什么重要

数学基准一直是 AI 能力叙事的重要支柱。从早期竞赛题数据集,到近两年大模型在奥数、形式化证明上的表现,厂商常把“模型做出了某道难题”当作推理能力的硬证据。数学家集体发声,等于直接质疑这套评价体系的合法性。

这会波及几个层面:一是模型评测的话语权,如果顶级数学家不认账,厂商标榜的“推理能力提升”就需要更谨慎地解释;二是数据与算力的投入方向,如果数学题不再是有效卖点,部分训练和推理资源的分配逻辑会被重新审视;三是数学研究社区与 AI 公司之间的合作关系,包括形式化证明工具、开源数学数据集等项目可能面临更严格的审视。

对用户/开发者/创作者的影响

对开发者而言,数学 benchmark 分数作为模型选型依据的可信度会打折。调用 API 做复杂推理任务时,更值得关注的是模型在你自己业务场景里的表现,而不是排行榜上的数学成绩。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和内容生产者来说,这场争论提示了一个更普遍的问题:AI 能解出题,和 AI 能产生有价值的理解,是两回事。用大模型辅助数学、科研或技术写作时,需要保留人类对问题和方向的判断。

对企业采购方,供应商拿数学成绩做营销时,可以要求对方说明评测数据集来源、是否涉及训练数据污染,以及这类能力与实际业务的关联度。

值得关注的后续

一是这 25 位数学家的意见是否会形成正式公开文件,以及是否有 AI 公司作出回应。二是主流数学基准(如竞赛题、形式化证明任务)是否会调整评测口径,或出现新的、更贴近研究实践的评测方式。三是 AI 公司与数学研究社区在开源数据集、形式化工具上的合作是否因此放慢。目前公开信息显示,这仍是一场关于评价标准的争论,尚不涉及具体产品的下架或监管动作。

来源:Techmeme

celebrityanime
celebrityanime
文章: 23003

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注