小红书开源 BigMac:把多模态训练的显存与速度,从二选一中解放出来

小红书 Dots Infra 团队于 7 月 22 日开源 BigMac,一种针对多模态大模型(MLLM)的训练调度新范式。它让模型训练不再需要在“算得快”和“省显存”之间做取舍,在两类典型负载下分别实现了 1.1 倍和 1.9 倍的训练加速。

小红书开源 BigMac:把多模态训练的显存与速度,从二选一中解放出来

一句话看懂:小红书 Dots Infra 团队于 7 月 22 日开源 BigMac,一种针对多模态大模型(MLLM)的训练调度新范式。它让模型训练不再需要在“算得快”和“省显存”之间做取舍,在两类典型负载下分别实现了 1.1 倍和 1.9 倍的训练加速。

事件核心:发生了什么

多模态大模型通常包含模态编码器、LLM 骨干和生成器三大模块,形态差异大,放入同一训练流水线会引发效率问题。此前行业存在两种主流方案:一种将编码器和生成器独立出 LLM 流水线运行,计算高效但显存随微批次增长;另一种将所有模块并入同一流水线,节省显存却容易因单模块延迟拖慢整体,产生“尾气泡”。

BigMac 的关键创新在于,它将高度优化的 LLM 流水线调度(如 1F1B 等成熟策略)作为底层时间线,在不打断 LLM 执行顺序的前提下,把编码器和生成器的计算插入到输入就绪的位置。小红书团队称这个方案为“准依赖安全嵌套流水线”,其效果是:编码器和生成器的耗时波动不再沿流水线传播,同时模态激活的显存需求在算法层面降为 O(1)。

开源地址已托管至 GitHub 的 Dots-Infra 组织,BigMac 提供了全局调度可视化、对算法工程师透明的流水线并行接口,以及性能剖析、模拟和可视化工具链。

为什么重要

多模态模型正成为下一个 AI 应用的基础,但训练系统的瓶颈长期未解决——算力需求增长快于显存摩尔定律,现有框架迫使团队在显存和速度之间选择妥协。BigMac 并非单纯优化某个组件,而是从调度结构上打破了这种二选一的帕累托边界。实测数据显示,在以 Qwen3-30B-A3B 为骨干、搭配 1.3B ViT 编码器的理解类任务中,BigMac 相比计算优先的基线加速 1.08–1.1 倍;相比显存优先的基线(Megatron 等)加速达 1.6–1.9 倍。这意味着,在不增加 GPU 数量的情况下,原本受显存限制无法训练的多模态模型可能变得可行,对资源有限的中小型团队尤为关键。

此外,BigMac 的开源策略和接口设计降低了多模态模型的工程门槛——算法工程师只需定义模块的输入输出,阶段划分与通信调度由框架自动处理,这有望吸引更多开发者和研究者进入多模态训练领域,推动技术路线从文本大模型向原生多模态收敛。

对用户/开发者/创作者的影响

对于大模型开发者,BigMac 提供了一种可直接集成的训练工程方案:它兼容 Megatron Core 等 LLM 训练后端,支持通过模拟器在真实投入前预估气泡开销,降低了因调度不当导致算力浪费的风险。对于图像/视频生成类应用的创作者,如果其依赖的模型(如基于 ViT 编码器的 MLLM)转向 BigMac 优化,训练成本的下降可能间接促进模型更新频率加快,最终影响推理端的模型质量。不过目前开源版本更多面向技术团队,普通用户暂无直接使用场景。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 BigMac 能否在更大规模集群(千卡以上)中保持稳定性和加速比,目前公开信息主要基于典型负载验证,大规模分布式训练中的通信竞争和故障恢复尚未详细披露。二是竞品框架(如 DeepSpeed、Megatron 的后续版本)是否会引入类似调度策略,开源社区的接受度和二次开发活跃度将直接影响 BigMac 的生态位。三是小红书 Dots Infra 团队是否会将 BigMac 与自身业务(如内容理解、多模态搜索)打通,出现可直接使用的生产级案例。

来源:AIbase

celebrityanime
celebrityanime
文章: 14786

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注