Anthropic 宣布 Claude 用 11 天完成费马大定理首个端到端形式化证明

Anthropic 的 Claude 通过多智能体协作,在 11 天内自动完成了费马大定理的端到端计算机形式化验证,将原本预计需要数年的数学工作压缩至两周内。这项成果展示的并非 AI 提出新证明,而是 AI 在严格形式化验证领域的规模化能力。

一句话看懂:Anthropic 的 Claude 通过多智能体协作,在 11 天内自动完成了费马大定理的端到端计算机形式化验证,将原本预计需要数年的数学工作压缩至两周内。这项成果展示的并非 AI 提出新证明,而是 AI 在严格形式化验证领域的规模化能力。

事件核心:发生了什么

Anthropic 于当地时间 9 月 4 日宣布,其 AI 模型 Claude 在基本自主运行 11 天后,完成了对费马大定理的首个端到端、由计算机检查的形式化证明。这项工作并非重新发现该定理的数学证明,而是将英国数学家安德鲁·怀尔斯自 1995 年以来公认的经典证明,转换为了 Lean 证明助手可逐步验证的形式。

根据 Anthropic 披露的信息,Claude 在此过程中生成了约 1300 万行 Lean 代码,证明了约 3.03 万个定理,其中约 2.95 万个中间定理被纳入最终证明,整个证明仅使用 Lean 的 3 条标准公理完成检验。该项目由 Anthropic 研究人员、哥伦比亚大学助理教授 Tianyi Peng(清华姚班 2017 届本科,MIT 博士)发起,使用了多智能体协作系统及 Prove2Me 平台,通过有向无环图管理定理依赖关系,支持多个 Claude 智能体并行工作。项目消耗了约 60 亿个输出 Token,使用的是与 Claude Fable 5.1 大致相当的通用内部研究模型。人类研究员的输入主要是少量高层次指令,具体证明过程由 Claude 完成。完整证明代码已公开在 GitHub 上。

为什么重要

这项工作的突破点在于速度和规模。数学形式化的最大难点在于,人类证明中大量“显而易见”的推导步骤需要被 Lean 逐一验证,而历史数学成果的形式化通常需要数年时间。Anthropic 此前也预计该证明可能需要数年。此次 Claude 通过自动化的多智能体流程,将这一周期压缩至 11 天,且最终生成的证明规模超过 Mathlib(主要数学证明库)的 5 倍,说明 AI 在长链条逻辑推理与大规模代码生成方面的能力正在逼近实际科研应用门槛。

尽管费马大定理的数学正确性早已确立,此次成果也并未宣称 AI 提出新证明思路,但“将已有数学成果快速形式化”这一技能本身具有方法论意义。如果类似技术能扩展到更多现代数学分支,AI 辅助验证新证明、降低人工审查成本将成为可能。这也为未来“AI 产出数学成果 + 自动形式化验证”的科研流程提供了基础工具。

对用户/开发者/创作者的影响

对数学和计算机科学相关研究者而言,这意味着未来验证复杂证明的成本可能显著下降——过去需要人类专家数月甚至数年的审阅工作,有望借助自动形式化工具加速。对 AI 开发者而言,此次成果展示了多智能体协作框架在长周期任务中的可行性,Prove2Me 平台的 DAG 任务分解方式或可为其他领域的复杂工程提供参考。对于关注开源生态的开发者,Anthropic 已公开完整 Lean 代码,可作为学习大型形式化工程或验证 AI 输出正确性的案例。对普通用户而言,目前没有直接可用的消费级产品变化,价值更多体现在基础科研效率提升上。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

值得观察的第一点是,Anthropic 是否会将此次验证流程产品化,例如开放类似的多智能体证明能力供学术机构付费使用。第二点是,这一方法能否复现到其他未被形式化的现代数学成果上,检验其泛化性而不只是单个案例的成功。第三点是,公开的 GitHub 代码是否能吸引 Lean 社区和数学家形成协作,进一步评估 Hugging Face 之外、Mathlib 生态对于 AI 生成代码的接受与维护方式。目前公开信息显示,Kevin Buzzard 已对该证明进行审阅,认为 AI 辅助形式化大型数学成果已取得重要进展,但具体审阅深度与结论细节尚待完整公开。

来源:IT之家(RSS)

celebrityanime
celebrityanime
文章: 22032

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注