一句话看懂:Anthropic 用多智能体系统在 11 天内完成了费马大定理的形式化证明,生成 1300 万行 Lean 代码。帝国理工数学家 Kevin Buzzard 承认被 AI“抢先”,但他同时指出,这并未给数学带来新认知,真正的信号是 AI 协作基础设施的成熟。
事件核心:发生了什么
Anthropic 于上周五公布了这项研究:数十个 Claude 智能体分工协作,生成了约 1300 万行 Lean 代码,证明了 30300 个中间定理,并最终完成了一个计算机可验证的费马大定理完整证明。整个运行消耗约 60 亿输出 token,使用了一个被描述为“大致对标 Claude Fable 5.1”的内部研究模型。按该模型公开定价(每百万输出 token 50 美元)估算,算力成本约 30 万美元。
帝国理工学院的 Kevin Buzzard 教授自 2024 年起就领导一个由 EPSRC 资助、为期五年、金额约 100 万英镑的同类形式化项目。他亲自编译并核验了 Anthropic 的代码,确认其通过标准检查工具。他在博客上以《Anthropic 抢先了我一步》为题撰文,给出了一个含金量颇高的双面评价。
为什么重要
Buzzard 的评价被大多数报道只截取了一半。在数学层面,他认为这次形式化“没有改变任何东西”——它忠实复现了 1995 年 Darmond、Diamond 和 Taylor 对怀尔斯证明的早期阐述,并没有引入新思想;他将怀尔斯证明的正确性概率定为 99.9%。但在工程层面,他用“意义重大”来形容:一个 AI 智能体集群在不到两周内端到端形式化了数千页文献,这意味着“边做研究边形式化”将成为可能。
更值得关注的是失败到成功的路径。Anthropic 罕见地披露,第一轮尝试完全失败——智能体在早期进展后彼此失去协作上下文,最终停滞。失败运行贡献了最终代码中约 7% 的非样板内容。修复问题的关键不是更强的模型,而是一个名为 Prove2Me 的开源协作平台。它用图谱维护定理状态、拆分文件加速编译、为每条语句保留自然语言说明,从而解决了多智能体协作中的“状态迷失”。这套平台配合 Claude Code 的多智能体框架,让同一批模型在几天内完成了任务。
对用户/开发者/创作者的影响
这个案例给开发者的直接启示是:在复杂任务中,模型的权重可能不再是唯一瓶颈。Anthropic 用同一个模型证明了失败与成功之间的变量是“协调层”——一个能明确下一步该做什么、谁做了什么、什么可复用的外部系统。对于正在用 API 构建复杂 AI 应用的团队,这意味着把精力投入到状态管理和任务编排上,可能比等待下一代模型更有效。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户的间接影响在于成本透明度。60 亿输出 token、30 万美元量级的推理消耗,显示了前沿 AI 研究的算力现实——这仍然是大公司和头部机构的游戏。但 Prove2Me 这类工具的开源,可能降低后续研究者的门槛。
目前公开信息显示,这次证明的 1300 万行代码暂时无法进入社区标准库 Mathlib。Buzzard 本人是 Mathlib 维护者,他表示 Mathlib 目前不接受“AI 审查”的提交,审查者也对 AI 生成的代码持保留态度,因为多数 AI 提交质量偏低。人类与 AI 协作产出的代码如何进入开源基础设施,将是一个棘手的治理问题。
值得关注的后续
第一,多智能体协调平台是否会成为下一个竞争焦点。Prove2Me 由 Anthropic 研究员与哥伦比亚大学合作开发、已开源,OpenAI 和 Google 是否会推出类似框架值得关注。
第二,AI 形式化是否会反过来提速数学研究本身。如果“边研究边形式化”成为常态,Lean 等证明助手社区可能面临 AI 生成代码的审查洪流,社区治理规则是否调整将直接影响这一赛道的发展速度。
第三,算力成本是否会变化。此次 30 万美元的估算来自内部模型按公开价折算,实际成本可能更低。若这类任务成为常规需求,推理价格将成为 AI 在科研领域大规模落地的硬约束。
来源:The Next Web


