一句话看懂:Google DeepMind研究员Tom Zahavy在一篇新论文中论证,当前大语言模型缺乏创造全新科学理论所需的“操纵性溯因”能力,而能够模拟物理世界的“world models”或许才是实现科学革命的真正路径。
事件核心:发生了什么
7月30日,Google DeepMind的Tom Zahavy在观点论文《LLMs can’t jump》中指出,语言模型无法引发科学革命。他借助爱因斯坦在给朋友Solovine的信中描绘的发现循环——从感官经验“跳跃”到公理,再通过逻辑推导得出可检验结论——以及哲学家皮尔士对推理的三分法(演绎、归纳、溯因),定位了关键瓶颈:语言模型只能完成“普通溯因”(从已知候选中选择最可能解释),但无法做到“操纵性溯因”,即创造尚不存在于语言模板中的新原因。
Zahavy以爱因斯坦的“最快乐想法”为例:自由落体者感觉不到重力这一洞见来自对物理感受的心理模拟,而非方程推导。他类比阿基米德在浴缸中通过水的上涌发现浮力原理。两类发现都依赖感官体验,而语言模型就像塞尔“中文房间”里的人——按照规则处理符号,却无法接触符号背后的物理经验。现有自动化科研系统,如Sakana的AI Scientist(重组现有概念)和DeepMind的AlphaEvolve(需要清晰误差信号),同样无法进行这种创造飞跃。
为什么重要
这篇论文直接回击了“大模型将加速科学发现”的流行叙事。Zahavy承认语言模型在演绎(如AlphaProof、Gemini、GPT-5在国际数学奥赛中夺金)和归纳(统计模式识别)上已经很强,甚至可能从爱因斯坦的假设出发推导出广义相对论,但创造假设本身所需的关键认知机制——操纵性溯因——是当前技术盲区。这解释了为什么AI在优化现有理论时表现优异,却无法像爱因斯坦那样在牛顿力学“成功”的背景下,仅凭水星近日点的小偏差就重写时空观。
论文将“world models”视为破解途径:具有身体模拟能力的模型,能通过与环境交互获得感官信号,从而为创造新公理提供数据基础。这对AI技术路线选择有直接影响——如果科学突破需要具身认知,那么纯文本大模型的天花板就会更加明显,而机器人、仿真环境、世界模型赛道将获得更强的理论支撑。
对用户/开发者/创作者的影响
对AI工具使用者:当前基于大模型的科研助手(如论文检索、代码生成、数据分析)仍是信息处理工具,不能替代科学家的直觉飞跃。依赖AI进行“自动发现”的应用需要明确其能力边界——它们擅长在已知框架内优化,但无法创造新范式。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对AI开发者:Zahavy的观点提示,若要突破科研自动化,可能需要转向“world models”架构,即让模型在虚拟或真实物理环境中获取感知反馈。开源社区可关注DeepMind在具身模拟上的后续研究,例如将AlphaFold式的结构预测扩展到更广泛的物理现象。
对投资者:纯语言模型在科学发现上的局限性可能影响估值逻辑。同时,具备模拟能力的世界模型(如特斯拉的自动驾驶感知、NVIDIA的Omniverse平台)可能获得更高的战略优先级。
值得关注的后续
第一,DeepMind是否会公开演示一个“操纵性溯因”能力的world models原型,将直接验证这篇论文的可行性。第二,Sakana等自动化科研团队是否会调整研究方向,从文本重组转向具身仿真。第三,如果大模型厂商(如OpenAI、Meta)试图反驳Zahavy的论点,可能推出基于强化学习和环境交互的新模型,届时需要观察其能否在“无预设公理”的情况下做出类似爱因斯坦的推理飞跃。


