一句话看懂:Anthropic 的 Claude 模型在无人干预的情况下,用 11 天完成了费马大定理的端到端 Lean 形式化证明,让计算机完整验证了这一定理。这件事的意义不在于 AI 发现了新数学,而在于 AI 大规模自动转化的能力已经达到可以处理顶级数学难题的水平。
事件核心:发生了什么
Anthropic 研究团队宣布,Claude 在一个名为 Prove2Me 的平台上通过多智能体协作,将英国数学家 Andrew Wiles 于 1995 年完成的费马大定理证明,转化为了 Lean 证明助手可逐步验证的格式。整个过程独立运行了 11 天,生成了约 1300 万行 Lean 代码,证明了约 30300 个定理,其中约 29500 个中间定理被纳入最终证明。最终的 Lean 验证仅使用了三个标准公理。作为对比,Anthropic 此前曾估算这类工作可能需要数年时间。该项目由研究员 Tianyi Peng 发起,人类研究者主要负责提供高层指令,例如确定某些数学对象的优先级,具体证明路径由 Claude 自行完成,整体消耗了约 60 亿输出 token,使用的是与 Claude Fable5.1(内部研究模型)相当的算力资源。完整的 Lean 证明代码已在 GitHub 上开源,数学家 Kevin Buzzard 审核后认为这是 AI 辅助形式化验证大型数学成就的重要进展。
为什么重要
长期以来,数学形式化的难点在于人类证明省略了大量“显而易见的推导步骤”,而 Lean 这类工具要求每个逻辑环节都被显式验证。过去把一份完整论文翻译成计算机可验证的代码可能要耗费数学家数月甚至数年。Claude 这次将原本 129 页的 Wiles 证明转换成计算机可逐行验证的格式,并且最终结果由 Lean 独立验证通过,意味着 AI 在数学严谨性上首次接近了可交付的状态。这一成果的实际价值并不局限于数学界——它展示了 AI 结合 Lean 这类形式化工具,可以承担需要持续数天、具备依赖管理能力的“大规模推理工程”。Anthropic 认为,如果这套技术能扩展到更多现代数学成果,未来新证明的验证周期可能从几年压缩到数周甚至数天。
对用户/开发者/创作者的影响
对 AI 领域的开发者来说,这次实践展示了多智能体系统在长周期、高复杂度任务上的可行性:多智能体协作不只是对话式任务分发,而是能够在有向无环图结构上管理依赖关系、并行推进数千个中间定理。Prove2Me 这种用依赖图分配任务、再由多个模型实例并行处理的模式,未来很可能被扩展用于代码库重构、大型软件验证或复杂系统调试。对数学和科研领域的用户而言,Claude 的这次表现意味着 AI 工具的实际边界已经不只是生成论文草稿,而是可以辅助进行完整逻辑链的构建与验证。长期来看,AI 生成的数学成果可能逐步形成默认配套形式化证明的惯例,这会降低数学研究中的纠错成本。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
未来值得观察三个方向:第一,这套自动化形式化流程是否会被复用于其他长期悬而未决的数学问题,例如黎曼猜想相关的现有证明体系,如果能以类似方式完成 Lean 验证,则意味着该技术具备普遍性而不是单一项目的偶然突破;第二,Lean 数学库 Mathlib 本身是否会因为此项目而快速膨胀——本次生成的证明体量已是 Mathlib 现有规模的五倍以上,这会给 Lean 生态的维护和工具链优化带来新压力;第三,Anthropic 是否会将类似的多智能体长任务能力以 API 或产品化的方式开放给外部用户,目前公开信息显示他们使用的是内部研究模型,尚未公布任何商业化的时间表。
来源:AIbase


