深入了解 Claude 的数学能力

Anthropic 一个未发布的研究版 Claude 在尝试证明黎曼假设时失败,却意外将黎曼 zeta 函数满足该假设的零点占比下界从 41.6% 提升到 67.2%,并给出了形式化可验证的证明。这是 AI 在开放数学问题上首次做出可验证的实质性贡献。

一句话看懂:Anthropic 一个未发布的研究版 Claude 在尝试证明黎曼假设时失败,却意外将黎曼 zeta 函数满足该假设的零点占比下界从 41.6% 提升到 67.2%,并给出了形式化可验证的证明。这是 AI 在开放数学问题上首次做出可验证的实质性贡献。

事件核心:发生了什么

Anthropic 近日公开了一项内部研究:研究人员让 Claude 对 1859 年提出、悬赏一百万美元的黎曼假设发起真正的挑战。Claude 未能证明该假设,但将一个长期未突破的下界常数从 41.6% 提高到 67.2%——即黎曼 zeta 函数的零点中,至少有 67.2% 位于黎曼假设所要求的那条垂直线上。

该成果基于未发布的研究版本 Claude,整个探索过程在 Claude Code 中完成,分两次会话进行:第一次尝试了 650 个想法全部失败;随后,Anthropic 员工 Jarred Sumner 让 Claude 再次尝试,它花费一天半时间协调约 60 个 Claude 子代理,运行了 2,400 条 shell 命令并编写数百个 Python 脚本,通过大量数值检验和互审机制逐步收敛到新结果。

Anthropic 内部两位数学家验证了 Claude 的论文,并邀请了 Brian Conrey 和 Dan Goldston 两位领域专家审阅。Claude 还生成了一份形式化可验证的证明,确保结论的严谨性。完整的数学论证与 Claude 的推理附录均已公开。

为什么重要

这是 AI 在基础数学研究中罕见的产出级突破。过去,大模型参与数学任务大多停留在解题或辅助计算层面,而这次 Claude 在无人给出具体方法提示的前提下,自主组合了 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 等人的近期工作与 Bombieri 2000 年的经典论文,找到了新的技术路径。这说明大模型的“研究能力”正从模式补全走向真正的发现——尽管 Anhtropic 明确表示,不指望这些技术能最终证明黎曼假设。

对 AI 行业而言,这一事件的价值在于验证了一个可复制的方法论:大模型 + 子代理协同 + 形式化验证,可以在高风险、高难度的开放问题中产出经得起专家审阅的结果。这比模型在评测集上刷分更能反映推理能力的实质性进步。

对用户/开发者/创作者的影响

对 Claude Code 用户来说,这次实验展示了多子代理协作处理长期复杂任务的潜力:60 个子代理分工、互相审阅、持续迭代的工作流并非科研特供,类似模式可复用到代码重构、数据分析、复杂调试等场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,Anthropic 已表明“数学能力进展速度在加快”,这意味着后续模型版本的推理能力会有持续提升,尤其是长上下文规划与工具调用闭环。API 用户应关注模型能力跃迁带来的应用层机会。

对数学与科研工作者,Claude 的产出提示了一个现实:AI 生成的证明需要也必须经过专业验证与形式化检查,不能因“结果正确”就默认过程无误。

值得关注的后续

首先,67.2% 这一下界能否被数学共同体正式认可,并在后续论文中被引用或改进,将是验证该成果学术价值的核心指标。其次,Anthropic 是否会将这种“多子代理深度研究”能力通过 Claude Code 或 API 开放给更大范围用户,值得跟进。最后,OpenAI、Google DeepMind 等竞品在类似开放数学问题上的布局,也可能因这次进展而加速公开。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 18302

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注