一句话看懂:OpenAI本周发布数百个高难数学问题的解答,但普林斯顿高等研究院主持的数学与AI咨询组AGMAI指出,其做法未完全遵循该组织9月底发布的指南,尤其在人类理解、形式化验证和公开透明方面存在差距。
事件核心:发生了什么
2026年10月8日,TechCrunch报道称,OpenAI本周发布了声称解决世界上最难数学问题之一的数百个方案。OpenAI表示已咨询精英数学家组成的顾问组,以避免重蹈此前模型解题引发争议的覆辙。但AGMAI在声明中表示,最终要由数学界评估其建议被遵循的程度。AGMAI的第一条建议就是停止在专有模型上测试高等数学问题,而OpenAI的发布明确说明正在用开放研究问题评估其专有模型。在719份手稿中,只有10份包含了模型思维链的发布内容;仅42%的证明经过了形式化验证。AGMAI还要求OpenAI“包含可机读的元数据,将自然语言与形式化产物关联”,但OpenAI并未做到。剑桥大学和伦敦国王学院本周发表的论文记录了OpenAI针对纳维-斯托克斯方程相关问题的自然语言证明与Lean代码之间至少两处不一致。
为什么重要
这一争议触及AI数学解题的核心矛盾:模型可以快速输出证明,但数学界更看重人类能否理解、验证并在此基础上继续推进。AI模型通常先产生自然语言解释,再尝试翻译成Lean代码来验证正确性,但翻译过程可能出错,而OpenAI此次未提供可机读的元数据来对照两者。哈佛大学数学教授Melanie Wood表示,模型给出解答时“人类理解尚未发生,工作才刚刚开始”。陶哲轩也在社交媒体上批评称,AI提示者往往在目标“解决”后就不再关心更广泛的数学领域,也不理解AI输出,无法回答问题、做报告或与领域互动。这说明当前评测仅证明模型能输出结果,不等于该结果已被数学界接受为可靠知识。
对用户/开发者/创作者的影响
对于依赖大模型做研究、工程或内容生成的用户,这次事件提醒:AI输出与经过同行评审的可靠结论之间仍有距离。开发者若在数学、物理或工程场景中集成模型推理结果,需要保留人工验证环节,不能仅凭模型声称“已解决”就采信。创作者和媒体在引用模型证明时,也应明确标注其未经过形式化验证或同行评审。目前公开信息显示,OpenAI此次发布的是研究性方案,并非已上线产品或可调用API。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是OpenAI是否会在后续发布中补充思维链和可机读元数据,并资助人类数学家跟进理解工作。二是AGMAI是否会公开评估OpenAI此次发布的具体结论。三是Lean等形式化工具与大模型的结合能否发展出更可靠的自动验证流程,减少自然语言与代码之间的翻译偏差。


