一句话看懂:围绕 AI“推理能力”的争论进入了一个矛盾阶段:大型推理模型(LRM)既在数学竞赛和科研问题上拿出惊人成绩,又被研究发现大量解题过程依赖表面捷径而非真正推理。结论是:AI 推理确实有效,但“有效不等于可解释”,其底层机制至今没有科学定论。
事件核心:发生了什么
Quanta Magazine 在 2026 年 7 月 31 日刊发长文,系统梳理了近两年 AI 推理能力研究的两极化进展。一路是成绩单:2026 年 5 月,OpenAI 的“通用推理模型”一次性解决了著名的开放数学研究问题;Google DeepMind 与数学家陶哲轩合作,用 AI 改进或重解了横跨分析、组合、几何和数论的 67 个问题;LRM 还曾在国际数学奥林匹克竞赛中斩获金牌。另一路是质疑:苹果研究者曾在 2024 年提出“思维的幻觉”批评,称推理链在简单条件下会出现“完全准确率崩溃”;圣菲研究所的 Melanie Mitchell 团队则发现,LRM 能用“表面级捷径”通过精心设计的类比喻视觉推理基准,表现更像“刷系统”而非泛化推理。Mitchell 在接受采访时概括了当前共识三条:第一,推理链确实提升任务准确率;第二,模型生成的推理文本并不一定忠实于内部实际过程;第三,相当一部分推理文本甚至无用,删掉也不影响结果。
为什么重要
这场争论真正影响的是 AI 行业如何评估和信任模型能力。“推理链”作为 LRM 的核心训练机制,已经被商业产品广泛采用,但科学界对它的本质判断尚未统一——它是模型内部计算的忠实外显,还是一种事后包装的流利文本?目前公开信息显示,两者证据同时存在。这种不确定性直接制约了:模型能力基准的可靠性、对“AI 安全对齐”的信心,以及企业是否能把关键决策托付给推理模型。如果模型只是“在某些任务上碰巧对了”,其能力边界就无法被预测,更谈不上可控。“有效但不可解释”的现状,比“完全无效”更让研究者和采购方感到棘手。
对用户/开发者/创作者的影响
对普通用户而言,不必因为个别“解决数学难题”的案例而把 AI 推理能力神秘化,也不应因“捷径研究”全盘否定其工具价值。一个务实的判断标准是:越是有可验证正确答案的任务,越可以放心让 LRM 辅助;越是开放性、高风险的判断,越需要人工复核。对开发者来说,调用 OpenAI 等推理模型 API 做复杂任务时,应意识到“推理链展示”不等于“真实思考过程”,产品界面向用户展示答案依据时需要谨慎设计,避免造成虚假的透明度;同时,推理模型往往消耗更多 token 和算力,成本预算要比普通大模型预留更充足。对创作者和研究者而言,评测时应引入反“捷径”基准,并关注模型在问题表述变化下的稳定性,而不是只看单一测试集的分数。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是可解释性研究是否会出现突破性方法,让推理链与模型内部计算建立可验证的对应关系。二是评测体系是否会升级——如果“表面捷径”被越来越多地识别,新基准的权威性将直接重估现有 LRM 能力排名。三是模型厂商是否会调整产品披露方式,例如在推理链中明确区分“必要步骤”与“装饰性文本”,这会影响企业采购和合规决策。建议关注 OpenAI、Google DeepMind 以及圣菲研究所的下一批公开研究结果。


