一句话看懂:NVIDIA 发文系统对比 Dense(稠密)与 MoE(混合专家)两种大模型架构,指出 MoE 靠“每个 token 只激活部分参数”把显存成本和推理算力解耦;选哪种不看参数总量,而看你的部署约束。
事件核心:发生了什么
NVIDIA Generative AI Blog 发布技术解读,梳理两种主流架构的差异。Dense 模型每个 token 都会跑完全部参数,例如 27B 模型就是 27B 参数全量参与前向计算;MoE 则把解码层里原本单个共享 FFN 换成多个专家网络,由前置的路由网络为每个 token 挑出得分最高的 top-k 个专家执行,其余跳过,且每一层都会重新路由。NVIDIA 自家的 Nemotron 3.5 Lightning 就是案例:总参数 30B 级别,但每 token 只激活约 3B 参数,采用 Mamba-2 + MoE + Attention 混合结构,还叠加了推测解码。文中提到 Mistral Small 4 等现代 MoE 还会固定保留一个所有 token 都走的共享专家。
为什么重要
关键不在“参数量”,而在 MoE 把显存和算力拆开了:显存按总参数算,算力按激活参数算。这意味着同样预算下,MoE 能塞进更大容量,却不必为每个 token 付出全量 FLOPs,官方称其吞吐通常更快。代价是路由和内存搬运会吃掉部分优势,高并发下差距收窄,服务复杂度也更高。这直接关系到推理成本、长上下文显存占用和私有化部署门槛,是目前公开信息里最值得开发者关注的架构分水岭。
对用户/开发者/创作者的影响
对调用 API 的开发者,MoE 往往意味着同价位更高的吞吐和更低的单 token 成本,但延迟波动可能更大;Dense 胜在延迟可预测、部署链路简单,适合对稳定性敏感的生产环境。做本地部署或私有化的团队要算两笔账:MoE 的显存门槛按总参数走,硬件采购不能只看“3B 激活”;长上下文场景下,带 Mamba-2 等混合层的模型显存曲线与纯注意力模型不同,需要实测。对内容创作者而言,这类差异最终会体现在生成速度和计费方式上,而不是模型名字里的参数量。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Nemotron 3.5 Lightning 这类混合架构是否会开放权重或 API,实际吞吐与延迟能否兑现宣传;二是路由效率、专家并行等工程方案能否压低 MoE 的部署复杂度;三是主流开源与闭源模型是否继续向 MoE 倾斜,以及推理框架对稀疏架构的支持进度。


