一句话看懂:OpenAI 在 GitHub 上公开了一个数学仓库,里面是一个内部模型产出的 722 篇数学手稿,覆盖 372 个结果族,其中一部分配有 Lean 形式化证明。这不是产品发布,而是把“大模型能不能做原创数学研究”这件事摆到了可公开检验的位置上。
事件核心:发生了什么
根据仓库 README,这些手稿来自一个未公开的内部 OpenAI 模型。OpenAI 表示,当现有数学评测趋于饱和后,他们把评估范围扩展到开放研究问题上,累计向模型提出约 4000 道题,平均每项结果消耗约 3 小时 ChatGPT Pro 级别的思考算力。最终筛选出 722 篇手稿、归入 372 个“结果族”,每个族内含主结果、配套论证、推论或替代证明,并按数学分支分类。仓库还单独发布了 10 个结果的推理摘要,涉及 π 的无理性指数、Mahler 猜想、量子海森堡铁磁体自发磁化、自由群因子同构、三维相对论 Vlasov–Maxwell 系统等方向。需要注意的是,并非所有结果都有 Lean 形式化验证,OpenAI 自己承认未形式化的部分“可能存在问题”。
为什么重要
过去大模型的数学能力主要靠竞赛题和基准测试衡量,这次的不同在于目标从“解题”转向“提出并论证新结果”,等于把评测标准换成了同行评审逻辑。配套的 Lean 库和 Comparator 检查说明,OpenAI 试图用形式化验证给模型输出做可信度分层:有形式化证明的、有人工编辑的、只有手稿的,可靠性并不相同。这既是对 AI 科研辅助能力的一次公开压力测试,也可能影响未来模型能力宣传的叙事方式——不再只报分数,而是交论文。
对用户/开发者/创作者的影响
对开发者而言,这个仓库更值得当作“研究范本”而非可直接调用的 API:它展示了如何用形式化工具管理模型生成的复杂推理内容。对研究者和数学工作者,它提供了一批可核查、可质疑的素材,尤其适合关注 π 无理性指数、Mahler 猜想等具体方向的读者自行比对。对普通用户,目前公开信息显示这并不直接改变 ChatGPT 的使用体验,但推理摘要中透露的“三小时思考算力”暗示,这类高算力推理模式的成本与调用门槛仍会显著高于日常对话。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是形式化覆盖率能否提升,未验证手稿是否会被修正或撤下;二是这些结果能否通过独立数学界的同行评审,而非只停留在自建仓库;三是 OpenAI 提到的“社区托管仓库”是否会落地,这直接影响外部研究者参与验证的便利程度。


