一句话看懂:OpenAI 内部未发布模型 Astra 在数学推理上取得突破,一次性解决了 10 个长期开放的数学问题,并且每个结果都附带 Lean 形式化验证证书。这提示大模型正在从“会聊天”跨向“能做出可验证的科学发现”。
事件核心:发生了什么
2026 年 8 月 3 日,OpenAI 公布了 Astra 模型的内部测试结果。Astra 是该公司下一款主要模型,此次在未正式发布的情况下,对一批开放数学问题给出了新结果,覆盖高维球堆积、非 sofic 群存在性、Connes 刚性猜想反例、算术电路复杂度下界、量子并行重复、最近向量问题、多色 Ramsey 数、Ehrhart 体积猜想等 10 个方向。
OpenAI 表示,这些结果由人工使用同一模型将论证整理成论文,并逐一在 Lean 证明助手中完成形式化验证。按 Sol API 价格估算,求解这些问题所需的全部 token 成本约 2000 美元。OpenAI 研究员 Noam Brown 补充说,团队也尝试了其他重大问题但未成功,目前还没有攻克千禧年大奖级别的难题。
为什么重要
数学一直是 LLM 的明显短板,此前的模型在严谨推理和长链条证明上表现脆弱。Astra 这一次展示的不是“解题技巧”,而是提出新构造、证明下界、构建反例的能力——这些需要真正的创造性推理,且可以由 Lean 自动验证,结果可信度远高于普通对话输出。
更值得关注的是成本信号:按原文估算,单个问题的算力开销折算后并不高。Noam Brown 也明确说“没有在每个问题上投入巨额计算”,这意味着测试时计算(test-time compute)的潜力可能被明显低估。业内评论还提出“数学证明 overhang”概念:一旦知道问题本身可以被模型解决,其他模型即便没有提示也能复现类似结果——Sol 和 Fable 已在聊天界面中独立证明了非 sofic 群的存在。数学能力正在成为多家大模型厂商的竞争焦点,而不只是 OpenAI 的孤例。
对用户/开发者/创作者的影响
目前 Astra 尚未开放,但按 OpenAI 的节奏,它最终会通过 API 提供给开发者。对开发者而言,这意味着未来可以用很低成本调用接近“数学家级”的推理与形式化验证能力——原文中 2000 美元级别的计算开销,很快就会随定价下降变得更便宜。对科研用户,Lean 证书让 AI 产出可以被自动核验,降低了误判风险。对普通用户,这类能力将随模型更新渗透到日常产品中,影响远不止数学领域。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Astra 的正式发布时间,以及它如何在 API 中定价;二是数学界对 10 个 Lean 证明的复核结果,是否会出现已发现的反例或错误典型;三是其他模型能否在同类问题上复现类似表现,验证“数学证明 overhang”是否成立;四是这种推理能力能否迁移到更多学科,例如


