英伟达 Nemotron 3.5 Lightning

英伟达发布了开源大模型 Nemotron 3.5 Lightning(30B 总参数、仅 3B 活动参数),主打低算力消耗和超长上下文,单张消费级或工作站级 GPU 即可运行,瞄准的是长时运行的 AI 智能体场景。

一句话看懂:英伟达发布了开源大模型 Nemotron 3.5 Lightning(30B 总参数、仅 3B 活动参数),主打低算力消耗和超长上下文,单张消费级或工作站级 GPU 即可运行,瞄准的是长时运行的 AI 智能体场景。

事件核心:发生了什么

英伟达于 8 月 11 日在 Hugging Face 上发布了 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型。这是一个采用 MoE(混合专家)+ Mamba-2 + Attention 混合架构的大语言模型,总参数 300 亿,但每次推理只激活 30 亿参数,上下文长度最高支持 100 万 token。模型同时提供 DSpark、MTP、DFlash 三种投机解码方案,用于提升生成速度。官方称可在单张 DGX Spark(GB10)或 H100 上部署,也支持 RTX 5090 等 Blackwell 架构消费级显卡,采用 OpenMDW-1.1 开源许可,可用于商业用途。

基准测试方面,该模型在 GPQA Diamond(无工具)上取得 75.57 分,SWE-bench Verified 上取得 52.80 分,IFBench(宽松)得分 72.88,属于目前开源模型中具备竞争力的水平。预训练数据截止到 2025 年 9 月,后训练数据截止到 2026 年 5 月。

为什么重要

这次发布的意义不在于把参数规模做大,而在于把一个 30B 模型的推理成本压低到“3B 活动参数 + 单卡可跑”的水平。对 AI 行业而言,这意味着高质量开源模型的部署门槛正在明显下降——不再需要多卡 A100 集群才能跑一个能用于 coding agent 的模型,一台工作站就能完成。

同时,Mamba-2 与 MoE、Attention 的混合架构也反映了行业对 Transformer 之外路线的务实态度:在长上下文和持续推理场景中,混合架构可以用更低显存开销处理更长序列。英伟达选择在这一代模型上同时推进混合架构、投机解码和 4-bit 量化(NVFP4),说明开源模型的竞争焦点正在从“谁能训出更大模型”转向“谁能在更便宜的设备上跑得更快、更久”。

对用户/开发者/创作者的影响

对于开发者,最直接的利好是本地部署成本大幅降低。30B 总参数的模型如果以 BF16 格式运行,需要约 60GB 显存,多数开发者并不具备;但 NVFP4 量化版本配合仅 3B 活动参数的 MoE 架构,让它在 24GB 显存的 RTX 5090 上运行成为可能。这意味着个人开发者可以在本地跑一个具备较强代码能力和 agent 能力的模型,不需要依赖云端 API,数据隐私和长期运行成本都更有优势。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于创作者,该模型支持英语、西语、法语、德语、意语和日语,适合做多语言对话类应用或 RAG 系统。不过目前官方没有强调中文能力,中文用户需要自行测试判断是否适用。对于企业用户,模型采用 OpenMDW-1.1 许可,允许商用,但需要关注该许可证对模型权重和训练数据的分发限制。

值得关注的后续

目前公开信息显示,该模型已提供 vLLM 部署示例,但 DSpark 投机解码方案在非英伟达硬件上的兼容性仍需验证。后续建议关注三点:

第一,该模型在真实长时序 agent 任务中的稳定性——100 万 token 上下文在实际应用中的效果与基准测试数字的差距有待社区验证。第二,混合架构路线是否会带动更多模型跟进,比如 Mamba-2 + MoE 的组合能否成为中小规模开源模型的常见选择。第三,英伟达把开源模型与自家硬件(DGX Spark、RTX 5090)绑定的策略是否奏效,以及 AMD、Intel 阵营是否会推出类似定位的优化部署方案。

来源:huggingface.co

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注