
一句话看懂:小红书与北大联合开源 UltraEP,它能在每个微批次和每一层动态复制热点专家,将大规模 MoE 模型训练和推理的吞吐提升至理想性能的 94% 以上——解决了此前专家并行中 GPU 负载不均、大量算力被白白浪费的核心痛点。
事件核心:发生了什么
小红书技术团队与北京大学联合提出并开源了 UltraEP,这是一套面向大规模 MoE(混合专家)模型的实时负载均衡方案。当前主流方案如 DeepSeek 的 EPLB 依赖历史路由信息周期性调整专家放置,但在细粒度 MoE(数百个小专家)的高动态负载下,历史信息迅速过时,冷热专家预测频频失准。UltraEP 的核心突破在于:它基于门控后的真实负载,在每个 micro-batch 的每一层实时执行专家复制与重路由,而不是依赖预测。在 Qwen3-235B、GLM4.5/4.7、DeepSeek-V3 等模型上的测试显示,训练平均达到理想吞吐的 94.6%,推理 prefill 达到 90%–97%;其中训练吞吐相比 Megatron-LM 提升 42%,推理吞吐相比 SGLang 提升 1.56 倍。该方案已经正式部署于小红书一个 288B 参数 MoE 模型的完整预训练中。
为什么重要
该方案揭示了业界一个长期被忽略的差距:即便模型在预训练阶段已经加入负载均衡算法,实际训推中不同 GPU 的计算负载仍可能相差数倍,导致理想(完美均衡)吞吐与实际表现最多差一倍。UltraEP 通过将负载均衡从“预测式”升级为“实时精确式”,并借助高带宽 scale-up 域内的专家复制、基于持久化算子的稀疏通信优化、以及跨层 buffer 复用(将冗余 slot 的显存开销从 9.9 GB 降至 108 MB),首次让生产级 MoE 训推逼近理论性能上限。这意味着在万亿参数模型的训练与推理中,算力利用率有了显著提升空间,而不是购买更多 GPU 来弥补损耗。目前公开信息显示,UltraEP 的核心判断是:随着通信带宽继续提升,这种实时、精确的系统侧负载均衡将成为专家并行的基础能力,与算法侧的负载均衡(负责训练稳定性和专家特化)形成自然互补。
对用户/开发者/创作者的影响
对于使用开源大模型进行二次训练或微调的企业团队,UltraEP 提供了一个即插即用的 Python/CUDA 运行时,可与 DeepEP 或主流训推框架解耦,方便接入。它能直接降低 MoE 模型训练和推理中的 GPU 闲置率,意味着在相同算力预算下可以跑更大的模型或更长的 token 序列。对于依赖大模型 API 的开发者,底层算力利用率的提升长期来看可能转化为更低的调用成本或更低的响应延迟。UltraEP 也已开源(GitHub: Dots-Infra/UltraEP),技术文档与论文可同步查阅,降低了技术接入门槛。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 UltraEP 能否被更多主流训推框架(如 Megatron-LM、SGLang、TGI)原生集成;二是团队已指出其下一步自然扩展方向是 RL(强化学习)场景——该场景负载高度动态且缺乏预训练中的算法侧均衡调控,若 UltraEP 能证明有效的统一负载调节能力,将显著影响强化学习训练基础设施的构建方式;三是竞品(如 DeepSeek 的 EPLB 系列)是否会跟进类似思路,推动行业从“预测式”向“实时精确式”方案的转向。


