一句话看懂:Anthropic 宣布,其 AI 模型 Claude 在 11 天内以近乎自主的方式,用 Lean 编程语言完成了费马大定理的首个完整机器验证证明。这是 AI 在数学严谨性验证上的一次实质性突破。
事件核心:发生了什么
Anthropic 于 9 月 4 日发布研究成果,称 Claude 在 11 天内完成了费马大定理(FLT)的机器可验证证明。这项工作由 Anthropic 研究员 Tianyi Peng 发起,他在哥伦比亚大学的团队专注于 AI 形式化工具。Claude 在此过程中生成了约 1300 万行 Lean 代码,并证明了 29,500 个中间定理。
费马大定理由皮埃尔·德·费马于 1637 年提出,1995 年由安德鲁·怀尔斯给出首个完整证明,原文长达 129 页。此后的数十年中,数学界一直在探索如何将这类复杂证明“形式化”——即转化为计算机可自动检查的逻辑语言。2024 年,伦敦帝国理工学院的 Kevin Buzzard 发起了使用 Lean 证明助手完成该形式化的多年社区项目。Anthropic 此次的成果,正是在这一背景下首次实现了端到端的机器验证。
为什么重要
这一成果的意义不在于 AI 发现了新的数学定理,而在于它完成了对已知复杂证明的“验算”。数学证明的验证通常需要数月甚至数年的人类专家时间,而 Claude 以 11 天的自主工作完成了这一过程。Kevin Buzzard 评价称,这一成果表明 AI 自动形式化的产物已经足够可靠,可以被进一步构建。
对 AI 行业而言,这标志着大模型从“生成文本”向“生成可验证逻辑”的延伸。与近期 AI 在黎曼猜想上的探索性工作不同,这里的关键在于形式化验证——相当于用计算器核对一笔天文数字级别的复杂账目。若该路线成熟,AI 生成的证明将不再依赖人类逐行审阅,而是直接交给机器检查,这可能改变数学研究的验证流程。
对用户/开发者/创作者的影响
对数学和计算机科学研究者来说,这意味着 Lean 等证明助手的使用门槛可能大幅降低。过去,将人类可读的数学证明改写为机器可查的形式需要专门技能,Claude 的成果表明 AI 可以承担这一繁重工作,让研究者更专注于提出新问题而非校对旧证明。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通 AI 用户而言,这提醒我们大模型的推理能力不仅限于自然语言。Claude 能处理长达 1300 万行代码的逻辑链,说明其长程规划和一致性维护能力已进入新的水平。对于依赖 AI 生成代码的开发者,这类能力意味着更复杂、更少逻辑漏洞的自动化输出成为可能。
值得关注的后续
目前可关注的观察点包括:其一,Anthropic 是否会将这一能力产品化,比如向 Lean 或 Coq 用户提供专用的 AI 形式化助手或 API;其二,该成果的验证链条是否经得起独立复现,尤其是 1300 万行代码是否有公开版本供社区复核;其三,社区项目(如 Buzzard 发起的 Lean 形式化计划)是否会将 Claude 的输出纳入主流工作流,以及 OpenAI、Google DeepMind 等竞品是否会跟进类似的形式化推理能力。目前公开信息显示,Anthropic 尚未公布该证明代码的完整开源计划。


