
一句话看懂:小红书技术团队开源了 BigMac,一种针对多模态大模型训练的流水并行新方案。它通过“嵌套流水线”设计,在不显著增加显存占用和计算空泡的前提下,将训练速度提升了 1.08 到 1.9 倍,解决了当前多模态模型训练中“要快就得费显存、要省显存就得慢”的两难问题。
事件核心:发生了什么
多模态大模型(MLLM)通常由视觉/音频编码器、大语言模型(LLM)主干和图像/语音生成器三个异构模块组成。训练这些模块时,现有方案面临明显取舍:要么将编码器和生成器独立于 LLM 流水线之外,获得高计算效率但需要缓存大量激活值,显存成本高昂;要么将它们整合进同一流水线以节省显存,但编码器或生成器的执行波动会拖慢整个 LLM 流水线,产生大量“空泡”。
BigMac 的核心创新是“依赖安全的嵌套流水线”。它保留 LLM 主干上已经高度优化的 1F1B 等成熟调度方案,同时将编码器和生成器的计算有序嵌入到 LLM pipeline 的“安全”间隙中。算法上,BigMac 将编码器和生成器的激活显存消耗降至常数级别(O(1)),同时不改变 LLM 的显存行为。实际测试中,相比基线方案,BigMac 实现了 1.08 至 1.9 倍的训练速度提升,且在 global batch size 增大时显存占用保持稳定。该方案已作为小红书技术团队自研的“dots”多模态训练框架的核心组件投入生产。目前,BigMac 已在 GitHub 上开源。
为什么重要
多模态大模型(如 GPT-4o、Sora 的代表性技术)正成为 AI 系统的基础,其训练规模远超纯文本模型。传统方案在显存与效率之间的“二选一”,直接限制了模型扩展和 batch size 的增长。BigMac 的出现打破了这一 Pareto 前沿,意味着开发团队可以在不牺牲训练速度的前提下,用相同的 GPU 资源训练更大规模的多模态模型——包括包含图像生成器的模型。这对于控制算力成本、缩短研发周期有直接价值。
此外,BigMac 在工程实现上解耦了全局调度与运行时执行,并提供了模型接口和性能调优工具链。这降低了将不同编码器、生成器接入流水并行的门槛,使算法工程师可以更专注于模型设计,而非底层并行系统的适配。其开源策略也意味着,整个社区都可以基于此方案加速自家多模态模型的训练迭代。
对用户/开发者/创作者的影响
对 AI 开发者与模型训练工程师:BigMac 提供了一个优于当前主流方案(如 Megatron Core 的默认调度)的训练框架选择。如果你正在训练或微调多模态大模型(例如包含 Vision Transformer 和扩散模型的扩散型 MLLM),可以预期在 GPU 集群上获得更高的吞吐量和更低的峰值显存,尤其是在 global batch size 较大时收益明显。建议关注其 GitHub 仓库的文档和可视化工具,直接评估在自家模型上的实际效果。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业采购与算力规划者:BigMac 在相同算力下的效率提升,意味着可以在更短时间内完成大规模多模态模型的训练,或在相同预算下探索更大的模型配置。对于计划采购 GPU 集群进行多模态训练的企业,该方案属于可落地、且由生产系统验证过的优化手段,值得纳入技术选型评估。
对普通用户与创作者:目前没有直接影响。BigMac 是训练端优化,不改变用户使用的 API 或产品。但若更多 AI 公司采用此类高效训练方法,长期来看有望加速多模态 AI 产品的迭代,例如更流畅的文生图、图生视频功能,或降低相关 API 的调用成本。
值得关注的后续
1. 是否有竞品跟进:BigMac 解决的是多模态训练中的通用瓶颈。Meta、Google 等拥有自研训练框架的大型团队是否会推出类似或改进方案?社区中其他开源项目(如 ColossalAI、DeepSpeed)是否会借鉴其嵌套流水线思路?
2. 实际落地效果:目前测试基于特定模型和实验环境,在更大规模集群(千卡以上)以及不同架构(如视频理解、多轮交互模型)上的实际收益有待更多第三方验证和报告。
3. 工具链成熟度:BigMac 提供了调度可视化、profiling 等工具,其在工程界的上手门槛和应用广度将直接影响该方案能否成为新的事实标准。


