面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型

面壁智能 OpenBMB 推出开源项目 MathForm,提供面向 Lean 4 数学自动形式化的框架、数据集和模型,用 367K 条已验证样本将自然语言数学命题自动转换为机器可验证的代码。它在多个基准上的表现已经超过参数量四倍于自己的竞品模型。

一句话看懂:面壁智能 OpenBMB 推出开源项目 MathForm,提供面向 Lean 4 数学自动形式化的框架、数据集和模型,用 367K 条已验证样本将自然语言数学命题自动转换为机器可验证的代码。它在多个基准上的表现已经超过参数量四倍于自己的竞品模型。

事件核心:发生了什么

8 月 21 日,面壁智能 OpenBMB 团队正式发布 MathForm,定位为面向 Lean 4 的数学自动形式化开源解决方案。项目包含三部分:MathForm 框架、FormalVerse 数据集,以及基于该数据训练的 MathForm-8B 模型。

MathForm 框架采用检索增强与验证引导的数据构造方式:检索规划器先从 Mathlib 中找出语句所需定义和已有形式化内容,生成器再根据 Lean 编译器诊断和语义一致性反馈进行最多三轮修订。这种“编译不过就改”的机制,目标是解决形式化领域的老问题——语句能编译通过,但可能偏离原题的语义。

数据集 FormalVerse 包含超过 367K 条已验证的 Lean 4 示例,每条样本均配对了自然语言陈述与可验证的 Lean 4 代码,覆盖多个数学分支。实验数据显示,在相同 100K 预算下,基于 FormalVerse 训练的模型一致性检查通过率为 60.32%,显著高于 FineLeanCorpus 的 46.53% 和 NuminaMath-LEAN 的 41.49%。MathForm-8B 在六项基准上达到 88.06% 语法检查通过率和 72.37% 一致性检查 Pass@8,性能超过 ReForm-32B 和 Goedel-Formalizer-V2-32B,而参数量仅为后者的四分之一。在最难的 FATE-H 和 FATE-X 子集上,它分别达到 63% 和 37% 的一致性检查通过率,比最强的专用基线高出 10 和 12 个百分点。

为什么重要

自动形式化一直是大模型数学推理落地的关键瓶颈。传统做法只要求“翻译成代码”,但代码正确不等于数学语义正确——同样的命题可能被映射到错误类型或定义上,导致机器验证失去意义。MathForm 把“语义一致性”作为训练和评估的核心指标,并配合编译反馈进行多轮修订,这实质上把数学定理证明的自动化推进了一步。

从行业格局看,该工作以 8B 参数模型击败 32B 级别的专有模型,进一步印证了高质量数据与验证驱动训练对中小规模开源模型的价值。这种路径降低了数学形式化对超大算力的依赖,使得更小的团队和研究机构有可能在该领域做出有意义的成果。

此外,MathForm 将框架、数据集、模型和代码全部开源,这为后续研究者提供了可复现的基线。数学知识一旦变为机器可检查的形式,其验证结果将不再依赖模型的黑盒输出,这对数学出版、竞赛训练和自动推理系统都有长远影响。

对用户/开发者/创作者的影响

对数学研究者和教育工作者而言,MathForm 提供了一条将自然语言命题导入 Lean 4 验证流程的实用途径,可以降低形式化入门门槛。对开发者来说,开源的框架和代码意味着可以直接在自己的数学推理或教育类应用里集成自动形式化能力,不需要从零训练模型。对使用 API 的工程团队,MathForm-8B 的模型权重可在 Hugging Face 获取,方便本地部署或微调,避免了依赖闭源接口带来的成本和数据隐私问题。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,MathForm 的论文、数据集、模型和代码均已放出。后续值得关注三个方向:一是该框架能否在 Lean 4 社区得到实际使用反馈,并进一步扩展覆盖的数学领域;二是 8B 模型的效率优势能否吸引更多团队跟进验证驱动的数据构造方法;三是这套方案是否会被整合进主流数学辅助证明工具链,从而影响数学出版和科研验证的实际流程。

来源:X:面壁智能 OpenBMB (@OpenBMB)

celebrityanime
celebrityanime
文章: 19745

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注