LLMs擅长什么样的数学?

2026年8月初,OpenAI宣称解决了十个重大数学与理论计算机问题,包括首个非sofic群构造和multicolour Ramsey数超指数增长。但数学家Gowers指出,LLM目前最擅长的是构造反例,而非给出完整证明——这定义了当前AI数学能力的边界。

一句话看懂:2026年8月初,OpenAI宣称解决了十个重大数学与理论计算机问题,包括首个非sofic群构造和multicolour Ramsey数超指数增长。但数学家Gowers指出,LLM目前最擅长的是构造反例,而非给出完整证明——这定义了当前AI数学能力的边界。

事件核心:发生了什么

菲尔兹奖得主、牛津大学数学家Timothy Gowers近日发布博客,讨论LLM在数学领域的真实能力。他明确说明文章写作时间是2026年8月,背景是OpenAI宣布解决了十个重大数学和理论计算机科学问题。这些问题包括首个非sofic群的构造,以及一个multicolour Ramsey数(存在三个3的塔式指数)的超指数增长证明。前者是群论中最重要的未解问题之一,后者是Ramsey理论中Gowers原以为有生之年未必能看到解答的问题。

Gowers强调,这些成果虽然令人印象深刻,但并没有迹象表明LLM在所有数学维度上都超过人类。如果它们真的全面超越,凭借速度优势,结果应该像洪水一样涌来。他指出一个显著模式:LLM解决的最著名问题几乎都是反例构造,而非证明,包括Jacobian猜想和单位距离猜想的相关突破。

为什么重要

这一观察挑战了一种流行叙事——即AI已经“会做数学”。Gowers分析了“反例”这个概念本身的复杂性。他以Vinogradov三素数定理为例说明:一个全称命题的否定未必就是“找反例”,因为构造一个不满足性质的整数往往仍是证明驱动的。真正的区别在于思考的起点:是围绕全称量词思考,还是围绕存在量词思考。

如果LLM确实擅长反例而非证明,这将深刻影响数学AI工具的技术路线。证明需要构建一条从公理到结论的连贯路径,涉及长程规划和抽象的中间步骤;而反例则更多依赖搜索、组合推理和快速试错——这两者对算力、推理链长度和模型架构的要求完全不同。Gowers本人也表示,目前还无法给出一个清晰的分类,但至少可以排除一些明显错误的解释。

对用户/开发者/开发者/创作者的影响

对数学家而言,LLM可以在反例探测、猜想证伪和极端情况搜索方面作为高效助手;但如果期望它们独立完成复杂定理的证明,目前需要大幅降低预期。对AI开发者来说,这提示了一个产品方向:与其追求通用的“数学解题器”,不如在特定领域(如组合数学、群论)构建反例搜索工具,配合传统符号计算系统使用。对AI研究者,Gowers对能力的哲学分析提醒我们,评估LLM数学能力时,任务本身的形式化表述方式会显著影响结果——这直接关系到基准测试设计的有效性。目前公开信息显示,OpenAI尚未公布这十个问题的完整技术细节,外部独立验证也仍在进行中。

值得关注的后续

第一,OpenAI是否会发布这十个问题的完整证明或验证路径,以及是否有独立数学家团队复现关键结论。第二,Gowers提出的“反例倾向性”是否会在后续模型迭代中被改变——如果模型在证明任务上的成功率明显上升,这个阶段性判断就需要修正。第三,数学界对LLM产出的验证标准是否会形成共识,特别是在非sofic群这类结论异常复杂、传统审稿流程难以覆盖的问题上。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 18270

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注