隆重推出 Olmo-core 3:面向大规模 MoE 的开放、可扩展训练基础设施

Ai2 于 2026 年 10 月 1 日发布 Olmo-core 3,用全新的 MoE 训练系统把稀疏大模型的训练规模推向万亿参数级,同时把 MoE 扩展带来的吞吐损耗压到较低水平。它值得关注,是因为训练基础设施本身就是当前大模型竞争中最稀缺、也最不开放的一环。

一句话看懂:Ai2 于 2026 年 10 月 1 日发布 Olmo-core 3,用全新的 MoE 训练系统把稀疏大模型的训练规模推向万亿参数级,同时把 MoE 扩展带来的吞吐损耗压到较低水平。它值得关注,是因为训练基础设施本身就是当前大模型竞争中最稀缺、也最不开放的一环。

事件核心:发生了什么

Olmo-core 3 是 Ai2 面向大语言模型训练的框架升级,核心变化是重写了开放混合专家(MoE)训练系统。此前 Olmo-core 的 MoE 实现基于 FSDP,需要为每个小批次反复收集和重分片模型权重;新版本转向以 DDP 为基础的系统,让专家常驻 GPU、只把数据路由过去,省掉重复搬运权重的开销。

据官方披露,在一个对比测试中,专家池从 8 个扩展到 128 个、每个 token 仍只激活 4 个专家,单 token 激活参数约 3.2B 基本不变,总参数容量从 4.6B 增至 47B,而训练吞吐下降不到 5%。在 8 张 NVIDIA B300 GPU 的初步测试中,该 47B MoE 每卡每秒处理 52,000 个 token,旧实现为 19,400,约为 2.7 倍。同一套基础设施已在超过一万亿总参数的规模上做过基准测试。

为什么重要

MoE 的吸引力在于用更少的激活参数换取更大的总容量,但专家分散在集群上会带来通信与协调成本,规模越大越容易吃掉效率红利。Olmo-core 3 的价值在于把这部分成本往下压,让“扩大专家池”不再必然等于“吞吐大幅下滑”。

更关键的是开放属性。目前公开信息显示,Ai2 同步提供了技术报告、代码和交互式 demo,这与 NVIDIA Megatron-Core 等相对封闭或绑定特定生态的方案形成差别。对算力和预算有限的高校实验室、中小团队来说,开源训练栈的可获得性,往往比模型本身的分数更能决定他们能否参与前沿工作。

对用户/开发者/创作者的影响

普通用户短期内不会直接感知变化,但开发者可以更早接触一套可复现的 MoE 训练路径:专家并行、流水线并行、分布式优化器,以及行级专家并行、GPU 驻留路由、分组 GEMM 和 MXFP8 低精度格式等优化手段,都已在框架内整合。这意味着做自研模型或微调的团队,能用更少的卡跑更大的稀疏模型,间接影响后续 AI 应用与 API 的推理成本结构。对企业采购而言,它提供了一个 Megatron-Core 之外的备选技术栈,但成熟度和工具链完整度仍需验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是这套栈是否能稳定支撑下一代 Olmo 的实际训练,而不只是基准测试;二是 MXFP8 在全流程中的端到端收益与精度损失如何平衡,官方素材中这部分数据尚未完整呈现;三是外部团队采用后的反馈,尤其是它在非 NVIDIA 硬件或异构集群上的可移植性。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 26783

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注