OpenAI 生成的数学手稿与配套证明工件

OpenAI 在 GitHub 上公开了一个数学仓库,里面是一个内部模型产出的 722 篇数学手稿,覆盖 372 个结果族,其中一部分配有 Lean 形式化证明。这不是产品发布,而是把“大模型能不能做原创数学研究”这件事摆到了可公开检验的位置上。

一句话看懂:OpenAI 在 GitHub 上公开了一个数学仓库,里面是一个内部模型产出的 722 篇数学手稿,覆盖 372 个结果族,其中一部分配有 Lean 形式化证明。这不是产品发布,而是把“大模型能不能做原创数学研究”这件事摆到了可公开检验的位置上。

事件核心:发生了什么

根据仓库 README,这些手稿来自一个未公开的内部 OpenAI 模型。OpenAI 表示,当现有数学评测趋于饱和后,他们把评估范围扩展到开放研究问题上,累计向模型提出约 4000 道题,平均每项结果消耗约 3 小时 ChatGPT Pro 级别的思考算力。最终筛选出 722 篇手稿、归入 372 个“结果族”,每个族内含主结果、配套论证、推论或替代证明,并按数学分支分类。仓库还单独发布了 10 个结果的推理摘要,涉及 π 的无理性指数、Mahler 猜想、量子海森堡铁磁体自发磁化、自由群因子同构、三维相对论 Vlasov–Maxwell 系统等方向。需要注意的是,并非所有结果都有 Lean 形式化验证,OpenAI 自己承认未形式化的部分“可能存在问题”。

为什么重要

过去大模型的数学能力主要靠竞赛题和基准测试衡量,这次的不同在于目标从“解题”转向“提出并论证新结果”,等于把评测标准换成了同行评审逻辑。配套的 Lean 库和 Comparator 检查说明,OpenAI 试图用形式化验证给模型输出做可信度分层:有形式化证明的、有人工编辑的、只有手稿的,可靠性并不相同。这既是对 AI 科研辅助能力的一次公开压力测试,也可能影响未来模型能力宣传的叙事方式——不再只报分数,而是交论文。

对用户/开发者/创作者的影响

对开发者而言,这个仓库更值得当作“研究范本”而非可直接调用的 API:它展示了如何用形式化工具管理模型生成的复杂推理内容。对研究者和数学工作者,它提供了一批可核查、可质疑的素材,尤其适合关注 π 无理性指数、Mahler 猜想等具体方向的读者自行比对。对普通用户,目前公开信息显示这并不直接改变 ChatGPT 的使用体验,但推理摘要中透露的“三小时思考算力”暗示,这类高算力推理模式的成本与调用门槛仍会显著高于日常对话。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是形式化覆盖率能否提升,未验证手稿是否会被修正或撤下;二是这些结果能否通过独立数学界的同行评审,而非只停留在自建仓库;三是 OpenAI 提到的“社区托管仓库”是否会落地,这直接影响外部研究者参与验证的便利程度。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 27726

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注