一句话看懂:英伟达发布了开源大模型 Nemotron 3.5 Lightning(30B 总参数、仅 3B 活动参数),主打低算力消耗和超长上下文,单张消费级或工作站级 GPU 即可运行,瞄准的是长时运行的 AI 智能体场景。
事件核心:发生了什么
英伟达于 8 月 11 日在 Hugging Face 上发布了 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型。这是一个采用 MoE(混合专家)+ Mamba-2 + Attention 混合架构的大语言模型,总参数 300 亿,但每次推理只激活 30 亿参数,上下文长度最高支持 100 万 token。模型同时提供 DSpark、MTP、DFlash 三种投机解码方案,用于提升生成速度。官方称可在单张 DGX Spark(GB10)或 H100 上部署,也支持 RTX 5090 等 Blackwell 架构消费级显卡,采用 OpenMDW-1.1 开源许可,可用于商业用途。
基准测试方面,该模型在 GPQA Diamond(无工具)上取得 75.57 分,SWE-bench Verified 上取得 52.80 分,IFBench(宽松)得分 72.88,属于目前开源模型中具备竞争力的水平。预训练数据截止到 2025 年 9 月,后训练数据截止到 2026 年 5 月。
为什么重要
这次发布的意义不在于把参数规模做大,而在于把一个 30B 模型的推理成本压低到“3B 活动参数 + 单卡可跑”的水平。对 AI 行业而言,这意味着高质量开源模型的部署门槛正在明显下降——不再需要多卡 A100 集群才能跑一个能用于 coding agent 的模型,一台工作站就能完成。
同时,Mamba-2 与 MoE、Attention 的混合架构也反映了行业对 Transformer 之外路线的务实态度:在长上下文和持续推理场景中,混合架构可以用更低显存开销处理更长序列。英伟达选择在这一代模型上同时推进混合架构、投机解码和 4-bit 量化(NVFP4),说明开源模型的竞争焦点正在从“谁能训出更大模型”转向“谁能在更便宜的设备上跑得更快、更久”。
对用户/开发者/创作者的影响
对于开发者,最直接的利好是本地部署成本大幅降低。30B 总参数的模型如果以 BF16 格式运行,需要约 60GB 显存,多数开发者并不具备;但 NVFP4 量化版本配合仅 3B 活动参数的 MoE 架构,让它在 24GB 显存的 RTX 5090 上运行成为可能。这意味着个人开发者可以在本地跑一个具备较强代码能力和 agent 能力的模型,不需要依赖云端 API,数据隐私和长期运行成本都更有优势。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于创作者,该模型支持英语、西语、法语、德语、意语和日语,适合做多语言对话类应用或 RAG 系统。不过目前官方没有强调中文能力,中文用户需要自行测试判断是否适用。对于企业用户,模型采用 OpenMDW-1.1 许可,允许商用,但需要关注该许可证对模型权重和训练数据的分发限制。
值得关注的后续
目前公开信息显示,该模型已提供 vLLM 部署示例,但 DSpark 投机解码方案在非英伟达硬件上的兼容性仍需验证。后续建议关注三点:
第一,该模型在真实长时序 agent 任务中的稳定性——100 万 token 上下文在实际应用中的效果与基准测试数字的差距有待社区验证。第二,混合架构路线是否会带动更多模型跟进,比如 Mamba-2 + MoE 的组合能否成为中小规模开源模型的常见选择。第三,英伟达把开源模型与自家硬件(DGX Spark、RTX 5090)绑定的策略是否奏效,以及 AMD、Intel 阵营是否会推出类似定位的优化部署方案。


