How a Claude model made a math breakthrough during its unsuccessful 54-hour attempt to solve the Riemann hypothesis after a user repeatedly encouraged it (Ben Cohen/Wall Street Journal)

一个 Claude 模型在用户长达 54 小时的反复鼓励下尝试攻克黎曼猜想,虽然最终没有成功,却在推理过程中意外做出了数学上的实质性突破。这件事值得关注,因为它展示了 AI 推理中“过程”与“结果”的复杂关系,也让人重新审视提示交互对模型能力的实际影响。

一句话看懂:一个 Claude 模型在用户长达 54 小时的反复鼓励下尝试攻克黎曼猜想,虽然最终没有成功,却在推理过程中意外做出了数学上的实质性突破。这件事值得关注,因为它展示了 AI 推理中“过程”与“结果”的复杂关系,也让人重新审视提示交互对模型能力的实际影响。

事件核心:发生了什么

据《华尔街日报》报道,一名用户在一次长时间的人机协作实验中,持续鼓励一个 Claude 模型尝试解决数学领域著名的黎曼猜想。这次尝试持续了 54 小时,模型最终未能证明或推翻该猜想,但在此过程中产出了一个被评价为有实际价值的数学发现。这个结果既不在计划之内,也和原目标不一致,属于典型的“意外收获”。报道经 Techmeme 在 2026 年 8 月 16 日转发确认,但没有透露模型的具体版本、训练参数或该数学发现的详细内容。

为什么重要

这则新闻的意义不在于“AI 解决了数学难题”,而在于它提供了一个罕见的观察样本:在大规模推理任务中,模型面对无法完成的目标时,仍然可以沿推理路径产生有效输出。目前公开信息显示,Claude 模型本身没有为黎曼猜想做专门优化,用户也没有输入额外的数学知识,唯一的变量是持续 54 小时的交互性鼓励。这对 AI 研究界提出了一个值得思考的问题:推理大模型的“调试方式”——包括提示词设计、交互节奏和人类反馈——是否比模型本身的静态能力更能左右最终成果。如果这个现象可复现,将直接影响大模型在科研、数学和工程场景中的部署方式。

对用户/开发者/创作者的影响

对于普通用户,这个案例最直接的启发是:与大模型对话时,持续、结构化的反馈和鼓励可能比一次性给出复杂指令更有效,尤其在处理长期推理任务时。开发者则需要留意,基于大模型构建科研辅助工具时,不能只关注“正确答案率”,还要考虑对模型中间过程的记录和评估机制,因为“失败的尝试”可能包含有价值的结果。对创作者而言,这次事件也提示了一个内容方向:AI 在未完成任务中生成的知识副产品,可能会成为新的研究热点和产品功能点。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前有几个具体观察点值得跟进:第一,Anthropic 是否会针对这类长时间推理任务发布更新的日志、评估方法或产品功能,比如更完善的思维链记录;第二,该数学发现是否会被独立验证并正式发表,这将决定这件事从“逸闻”变成“学术成果”;第三,其他头部大模型厂商是否会启动类似的长时推理实验,尤其是开源模型社区,如果复现成本低,可能出现一批针对“长时间人机协作”的测试基准。需要注意的是,原文没有提供模型版本和实验的可复现细节,在更多信息公布前,不宜对 Claude 的推理能力做过度解读。

来源:Techmeme

celebrityanime
celebrityanime
文章: 18824

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注