OpenProblemBench发布:82道未解数学物理题评测AI,GPT-6-Astra解决率14%

arXiv 上线 OpenProblemBench,用 82 个数学与理论物理未解问题评测 AI,四个评审模型独立判分,GPT-6-Astra 以 14.0% 平均判定解决率居首,但整体仍处低位。

一句话看懂:arXiv 上线 OpenProblemBench,用 82 个数学与理论物理未解问题评测 AI,四个评审模型独立判分,GPT-6-Astra 以 14.0% 平均判定解决率居首,但整体仍处低位。

事件核心:发生了什么

2026 年 10 月 9 日提交至 arXiv cs.AI 的论文提出 OpenProblemBench,一个从数学和理论物理文献中挑选的 82 个未解问题基准。每个问题附带研究背景、假设和已有进展,选择标准是拟议解答中决定性的数学或计算主张可以被相对清晰地检查。评测不依赖参考答案,由四个评审模型独立评估提交内容的正确性、完整性和推进程度。在七种被评估配置中,GPT-6-Astra 取得最高平均判定解决率 14.0%,被评估的全尺寸开放模型为 5.5% 至 6.7%,Flash 类模型为 2.4% 至 3.7%。

为什么重要

现有 AI 基准多测量已确立知识的掌握程度,而 OpenProblemBench 试图把评测推向研究前沿的开放性难题。这为比较不同大模型的深层推理能力提供了一个更难的标尺,也把“AI 能否作为基础理论科学的贡献者”变成可测量的研究问题。对行业而言,如果这类基准被持续采用,模型能力的竞争可能从刷榜式问答转向真实科研推进度,闭源与开源、全尺寸与轻量模型之间的差距也会被更清楚地暴露。目前公开信息显示,这仍是论文层面的基准发布,不是已上线的产品功能。

对用户/开发者/创作者的影响

对开发者和研究者,OpenProblemBench 提供了一种评测思路:用领域文献中的开放问题、上下文假设和可检查主张来构造任务,而不是只依赖标准答案。若后续开放数据集或 API,模型训练和推理评估可能增加“科研问题推进”这一维度。对企业采购,这意味着选型时可以关注模型在长链条数学证明和理论推理上的表现,而不仅是通用对话能力。对内容创作者和 AI 应用开发者,这类基准也提示:高质量推理仍依赖问题表示、超越有限证据的一般论证,以及补全证明步骤的能力,产品设计若涉及数学、物理或科研辅助,需要更谨慎地标注不确定性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 OpenProblemBench 是否会公开完整题目、评审协议或提交排行榜,让结果可复现;二是其他团队是否会跟进类似开放问题基准,推动模型在理论科学任务上的横向比较;三是 GPT-6-Astra 的 14.0% 是否能在同一评测条件下被后续模型或新配置刷新。由于本文仅基于摘要信息,实际实验细节和评审可靠性仍需等待全文及社区验证。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28553

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注