GPT-6 Astra 让数学家们喘了口气,OpenAI 说这是有意为之

OpenAI 的 GPT-6 Astra 在 ulam.ai 的 ErdosBench 开放数学难题基准上拿下第一,但首席科学家 Jakub Pachocki 明确表示,公司并未把数学能力作为优化重点,这是资源投向递归自我改进(RSI)和自动对齐研究后的副产品。这为"AI 能力是全面还是尖锐分化"的争论提供了…

一句话看懂:OpenAI 的 GPT-6 Astra 在 ulam.ai 的 ErdosBench 开放数学难题基准上拿下第一,但首席科学家 Jakub Pachocki 明确表示,公司并未把数学能力作为优化重点,这是资源投向递归自我改进(RSI)和自动对齐研究后的副产品。这为”AI 能力是全面还是尖锐分化”的争论提供了一个来自头部实验室的证据。

事件核心:发生了什么

2026 年 9 月,OpenAI 发布 GPT-6 Astra。在覆盖 226 道受 Erdős 问题启发的开放数学难题基准 ErdosBench 上,Astra 得分为 3.23,共解决 106 道题,其中 43 道完全解出,另有 27 道被它证伪。相比此前最高推理档位的 Sol(解决 78 道),Astra 在科学写作上更强,也更少夸大结论,部分场景甚至低估了自己的结果。基准开发者 Przemek Chojecki 称其在多项数学研究技能上约带来 5%–10% 的稳定提升。目前 Fable 5.1 以 3.25 分反超登顶,但 Astra 解出的题目总数仍是最多的。

关键点在于,OpenAI 首席科学家 Jakub Pachocki 在文章《An Alien Mind》中写道,公司本可以通过额外投入让模型在数学研究上更强,但由于对 RSI 和自动对齐研究的紧迫感,并未把这一方向列为优先项。也就是说,当前最强的数学表现之一,并非定向优化的结果。

为什么重要

这说明即便是头部实验室,也无法在所有能力方向上同时拉满。资源投向哪里,能力就在哪里增长;把权重押在 RSI 上,数学能力就只能作为副产品出现。剑桥研究者 Adam Hunt 曾用两条路径对比这一趋势:一条是”主流 AGI”式的渐进全面进步,另一条是能力越来越”尖刺化”——在编码、数学等领域极强,但在语言质量、常识或社交推理上停滞甚至倒退。目前公开信息显示,Pachocki 的表态更接近后者。这也意味着大模型的能力边界正在被商业和战略优先级重新切割,而不只是靠训练规模自然外溢。

对用户/开发者/创作者的影响

对开发者而言,ErdosBench 这类基准的高分并不等于通用数学 API 能力同步提升,选型时需要按具体任务做验证,而不是只看榜单排名。对数学研究者,Astra 这类工具已经能参与证明与反证,但核心难点转移到”判断哪些结果真正有价值”上。对创作者和企业采购方,需要意识到模型的能力是分方向的:在数学、推理上游表现强,不代表在写作、常识、多轮对话等场景同样领先。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 OpenAI 是否会将内部更强的数学模型对外开放,以及以何种形式(API、产品功能还是闭源保留)。二是 Fable 5.1 与 Astra 的排名拉锯是否会推动新一轮基准更新,尤其 ErdosBench 尚未饱和。三是 RSI 与自动对齐研究的进展如何反过来影响数学等具体领域的能力曲线,这决定”尖刺化”是短期现象还是长期趋势。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 22694

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注