一句话看懂:OpenAI 研究员 Yong Zheng-Xin 发文反驳 Google DeepMind 科学家提出的“大模型无法实现科学跃迁”观点,认为当人类知识足够密集时,AI 可以通过跨学科连接和长链推理重现类似爱因斯坦的“天才一跃”。这场争论关系到未来 AI 在科研中的定位,以及安全对齐的难度。
事件核心:发生了什么
这场公开辩论源于今年 1 月 Google DeepMind Discovery Team 联合负责人 Tom Zahavy 发表的一篇 Position Paper(已入选 ICML 2026)。Zahavy 也是 AlphaProof 的主要贡献者之一,他在论文中提出“LLMs can’t jump”,认为当前大模型擅长归纳和演绎,但缺少科学发现中关键的“Abduction”能力——即从已知现象直接跳到全新解释框架,例如爱因斯坦从加速度与重力等价出发,构建广义相对论。
在 OpenAI 从事 RSI(递归自我改进)和 AI Safety 研究的 Yong Zheng-Xin(布朗大学博士)随后撰文《LLM can jump》提出反驳。他的核心论点是:爱因斯坦时代知识稀缺,但今天人类已补齐大量知识节点。Feynman 曾展示,如果假设爱因斯坦不存在,从量子场论出发研究无质量、自旋 2 的粒子,在 Lorentz invariance、能量动量守恒和自洽性约束下,同样能推导出广义相对论。当知识足够丰富,天才的“跃迁”可能退化为一条可被长推理链覆盖的路径。今年 OpenAI Astra 解掉 unit-distance problem 的案例被视为佐证:它将代数数论中的 class field towers、Golod-Shafarevich theory 与离散几何连接,解决了一个长期开放问题。
为什么重要
这场争论直接关系到大模型在科研中的价值上限。如果 Zahavy 是对的,AI 只能充当“高级计算器”,科学突破仍依赖人类直觉;如果 Yong 是对的,那么随着知识库密度增加,AI 通过大规模搜索 + 验证产生的“意外连接”,在人类看来就是范式跃迁。这会影响 AI 公司在基础科研工具上的投入方向——例如 DeepMind 与 OpenAI 对推理模型、自动证明器和跨学科检索的研发优先级。Yong 的立场还带来一个安全警示:如果模型能自主重新推导出答案,那么通过删除训练数据中的“危险知识”来限制模型能力的做法可能失效,对齐难度将显著上升。
对用户/开发者/创作者的影响
对于科研人员和开发者,这场辩论提示了一个实际使用方式:与其期待大模型直接给出伟大发现,不如利用它做跨领域知识拼接。OpenAI Astra 的案例表明,模型在数学、物理等领域的价值可能在“找到两个相隔甚远的学科之间可验证的连接”,这要求使用者具备跨学科提问能力,而非单点深挖。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于创作者和普通用户,大模型的“跳跃”能力意味着,即使某个具体知识点被从训练数据中移除,模型仍可能从周边知识推理出结论。这不只影响科研,也影响内容创作中的事实核查与知识生成——模型可能生成在逻辑上自洽但历史上从未出现过的“重建性知识”。
对企业而言,若 AI 科学发现的核心变成“搜索空间 + 验证成本”,那么拥有更强推理算力、更完善的代码执行和证明器基础设施的团队将在科研自动化上占据优势,这会推动对推理时算力(inference-time compute)的持续投入。
值得关注的后续
第一,ICML 2026 正式收录后,Zahavy 的论文是否会引发更多实证研究来检验“Abduction”能力能否通过强化学习或检索增强获得,值得关注。第二,OpenAI Astra 在数学证明方向的具体技术路径——它是否依赖大量外部定理库、验证器和搜索算法——目前公开细节有限,若有后续论文或博客披露,将直接影响开发者对自动推理工具的选型判断。第三,Yong 提到的“删除数据无法实现安全对齐”问题,是否会在未来模型发布中被针对性讨论,例如更强调推理阶段的安全过滤而非训练数据清洗,也是安全社区会持续追踪的方向。
来源:@MaxForAI


