顶尖数学家称,LLM是强大的计算器,但不擅长创造性思考。

菲尔兹奖得主蒂莫西·高尔斯(Timothy Gowers)与普林斯顿高等研究院数学家彼得·萨纳克(Peter Sarnak)公开指出,大语言模型(LLM)在数学计算上表现出色,但在真正的创造性思维上存在明显天花板;DeepMind研究员汤姆·扎哈维(Tom Zahavy)的论文“LLMs Can't Jump…

一句话看懂:菲尔兹奖得主蒂莫西·高尔斯(Timothy Gowers)与普林斯顿高等研究院数学家彼得·萨纳克(Peter Sarnak)公开指出,大语言模型(LLM)在数学计算上表现出色,但在真正的创造性思维上存在明显天花板;DeepMind研究员汤姆·扎哈维(Tom Zahavy)的论文“LLMs Can’t Jump”将这一瓶颈归结为“操控性溯因”(manipulative abduction)能力的缺失。

事件核心:发生了什么

两位顶尖数学家近期分别对LLM的数学能力作出评价。高尔斯认为,当前模型擅长组合已知方法、并行尝试多条搜索路径,但在海量可能性中,缺乏判断力去挑选少数真正有效的路径。萨纳克则指出,AI可以从现有理论出发推导结果,但面对一个基础问题时,往往无法发展出支撑重大证明所需的新抽象概念。

这一观点与DeepMind研究员汤姆·扎哈维的论文“LLMs Can’t Jump”形成呼应。扎哈维将大模型在创造性任务上的瓶颈描述为“操控性溯因”——即为了解释新现象而发明全新基础假设的能力,这种假设通常没有现成的语言先例。他认为,世界模型(world models)可能是突破这一限制的潜在方向。

为什么重要

这些判断挑战了“Scaling Law将持续带来智能跃迁”的乐观叙事。如果顶尖数学家和大模型研究者的观察成立,那么LLM的能力增长可能正进入一个分化阶段:在代码编写、数学运算、已知题型等“搜索-匹配”型任务上继续进步,但在提出全新问题框架、构造原始理论假设等本质创造性工作上,其增长逻辑与人类智力并不相同。

这也让行业重新审视“更通用的AI”是否真的在逼近。目前公开信息显示,大多数大模型的能力提升仍集中在已有基准测试和熟悉问题空间内,跨领域的概念跳跃尚无系统性突破。对研究机构而言,世界模型或符号推理与神经网络结合的新架构可能比继续堆算力更值得关注。

对用户/开发者/创作者的影响

对普通用户而言,将LLM视为“高强计算器”而非“替代大脑的合作者”是更务实的定位:它能快速完成检索、组合、计算和初稿生成,但重大创意、科学假设或独立判断仍需要人来主导。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和企业来说,产品设计应避免夸大模型的“创造能力”。在数学、科研辅助、算法设计等专业场景中,LLM更适合承担辅助推导、文献综合和候选方案枚举的角色,而非自动产出核心创新。创作者同样如此:AI可以加速灵感素材的组织,但真正决定作品独创性、风格与结构的判断力仍需自身保有。

值得关注的后续

一是世界模型路线是否会从论文走向实际产品,例如让AI在物理模拟或可操作环境中验证“假设跳转”的有效性。二是2026年下半年主流大模型在数学奥林匹克题(IMO)和原创数学发现类基准上的表现,若仍有明显瓶颈,将侧面印证上述判断。三是企业采购方是否会从“全能通用大模型”转向“计算能力强+人机协同”的专用工具组合,这影响后续模型定价和API生态的走向。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 18791

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注