Anthropic几个小时前宣布了一件可能被严重低估的研究: 几十个Claude智能体用11天60亿token,几乎完全独立地完成了人类几十年来一直想完成、原本预计仍需数年的费马大定理端到端形式化证明。 https://t.co/LRGD2KsIft 但“AI证明了费马大定理”其实不是这里最有意思的地方。 几个细节非常震撼: Wiles 当年的证明只有129页。Claude把它变成了约1300万行Lean代码,最终用到约29,500个…

Anthropic 用几十个 Claude 智能体耗时 11 天、消耗约 60 亿 token,端到端完成了费马大定理的 Lean 形式化证明。这件事的重点不仅在于“AI 证明了数学难题”,更在于它展示了一种新的 AI 科研范式:大模型 + 多智能体协作 + 外部验证框架,可以连续运转两周完成超大规模工程任务…

一句话看懂:Anthropic 用几十个 Claude 智能体耗时 11 天、消耗约 60 亿 token,端到端完成了费马大定理的 Lean 形式化证明。这件事的重点不仅在于“AI 证明了数学难题”,更在于它展示了一种新的 AI 科研范式:大模型 + 多智能体协作 + 外部验证框架,可以连续运转两周完成超大规模工程任务。

事件核心:发生了什么

Anthropic 日前宣布了一项研究进展:其 Claude 模型组成的多个智能体,在 11 天内使用约 60 亿个输出 token,几乎完全独立地将费马大定理的证明(Wiles 于 1995 年发表的经典证明,原文约 129 页)改写成了约 1300 万行 Lean 代码,并最终让形式化证明中最顶层的“费马大定理”节点状态变为 PROVED

整个证明工程涉及约 29,500 个中间定理,并在通过 Lean core 验证后,又使用独立 kernel 复核了超过 100 万个声明。Anthropic 的公开仓库中明确标出了 106 个复用或改编自既有项目(如 Mathlib、Imperial College FLT 项目)的文件,因此严格来说,Claude 并非从零重现了证明思路,而是完成了“将人类证明转化为机器可逐行核验格式”的最后一公里——这一过程原本预计仍需数年时间。

为什么重要

这项研究最值得关注的不是“AI 解决了某个数学猜想”,而是它展示了 AI 系统在长时间、大规模任务中保持有效协作的能力。初期多个 Claude 智能体在协作中出现了遗忘进展、分工混乱等问题;而团队引入的 Prove2Me 框架,将整个证明拆解为一张巨大的有向无环图(DAG),让每个智能体能够实时了解“哪些定理已解决、哪些待办、自己下一步做什么”。这相当于给多智能体协作提供了外部记忆和任务调度机制。

这一模式可能构成一种新的 Scaling Law:Model × Agent × Harness。过去讨论缩放,主要指模型参数量和算力提升;而这里显示,通过适当的任务编排(Harness),模型能力与多智能体协作可以组合出规模远超单一模型能力上限的科研工程。这也意味着,“AI 组织”能持续推进多大的问题,可能比单一模型的效果更值得关注。

对用户/开发者/创作者的影响

对普通用户而言,这条新闻不必理解为“AI 短期将替代数学家”,但其技术路线对 AI 应用开发者有直接启发:多智能体系统若缺乏任务分解和状态同步机制,很快就会失控;Prove2Me 这种外部 Harness 的设计思路,可能适配到软件开发、数据清洗、复杂文档审查等需要拆解成子任务并持续追踪进度的场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于使用 API 的开发者,这项研究也提供了一个极端规模下的参考:60 亿 output token 的长程消耗意味着,未来复杂任务的成本将不再按单次推理计算,而需要按“项目级 Token 预算”来规划。对创作者而言,AI 在形式化验证领域的成功也侧面说明,面对“可自动验证正确性”的任务,AI 的产出可靠度已经达到相当水平;而开放式创意内容仍难有类似验证机制,幻觉问题也更难根除。

值得关注的后续

目前公开信息显示,Anthropic 尚未宣布是否将这项多智能体协作 Harness 能力产品化或开放 API。后续可以从三个方向观察:

一是这套“Harness + 多智能体 + 形式化验证”的组合能否扩展到数学以外的领域,比如大型代码库重构或复杂系统调试;二是 Anthropic 是否会公布完整的 Token 消耗成本模型与失败重试策略,这将直接影响开发者评估多智能体方案的预算;三是其他大模型厂商是否会跟进类似的多智能体工程评测基准,毕竟单一模型的数学能力已有不少排行榜,而“多智能体长程协作”目前还缺乏标准化的评估体系。

来源:@turingbook

celebrityanime
celebrityanime
文章: 22021

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注