Nvidia 开放权重模型 Nemotron 3.5 Lightning 优先速度而非极致智能

英伟达发布开放权重模型 Nemotron 3.5 Lightning,用不到同级模型四分之一的活跃参数,在智能基准上与 OpenAI 的 gpt-oss-120b 打平,同时跑出同类最快的推理速度——这是在算力成本压力下,大模型竞赛从“拼参数”转向“拼效率”的又一个信号。

一句话看懂:英伟达发布开放权重模型 Nemotron 3.5 Lightning,用不到同级模型四分之一的活跃参数,在智能基准上与 OpenAI 的 gpt-oss-120b 打平,同时跑出同类最快的推理速度——这是在算力成本压力下,大模型竞赛从“拼参数”转向“拼效率”的又一个信号。

事件核心:发生了什么

英伟达于 8 月 11 日发布了 Nemotron 3.5 系列的首个模型 Lightning。它延续了上一代 Nemotron 3 Nano 30B A3B 的混合 Mamba-Transformer 架构,总参数量为 316 亿,但每次推理仅激活 36 亿参数,属于典型的稀疏激活小模型。

据独立评测平台 Artificial Analysis 的数据,Lightning 在 Intelligence Index 上得分为 24,比上一代提升 9 分,与 OpenAI 的 gpt-oss-120b 持平,略低于英伟达自家、体量大四倍的 Nemotron 3 Super(26 分)。在同尺寸模型中,它仍落后于 Qwen3.6 35B A3B(32 分)和 Meta 的 Muse Glimmer(35 分)。

英伟达显然把差异化押在了速度上。用最终版 NVFP4 权重测试,Lightning 的吞吐量接近每秒 670 token,是 Google Gemini 3.5 Flash-Lite(386 token/s)的近两倍,完成一项智能基准任务仅约 0.5 分钟,而 Qwen3.6 35B A3B 需要约 3.5 分钟。更大的提升体现在 agent 能力上:其在 GDPval-AA v2 的 Elo 评分达 824,超过 gpt-oss-120b(800)和自家更大的 Nemotron 3 Super(698);Terminal-Bench v2.1 得分也从 7% 跃升至 24.3%。

为什么重要

Lightning 是英伟达“效率优先”路线迄今最明确的产品级验证。去年英伟达研究员在一篇被广泛讨论的论文中提出,百亿参数以下的模型可以胜任多数 agent 工作负载,成本仅为 700 亿到 1750 亿参数模型的十分之一到三十分之一。Lightning 用 316 亿总参数、36 亿激活参数实现了接近更大模型的成绩,同时在 agent 基准上反超自家大模型,说明小模型与稀疏激活的组合并非单纯妥协,而是能在特定场景下形成差异化优势。

这也让英伟达在开放权重模型领域找到了自己的位置:不追求与 Qwen、Meta 争夺“最强小模型”称号,而是锚定高吞吐、低成本、适合 agent 流水线的实用场景。对开发者而言,更关键的变量是:当模型质量差距缩小到可接受范围,单次推理成本与每秒能处理的请求数,往往比榜单名次更影响落地决策。

对用户/开发者/创作者的影响

对开发者最直接的价值是成本和速度。近乎两倍于同级竞品的 token 吞吐,意味着在相同预算下能服务更多请求,或将延迟压得更低,这对 agent 类应用(如代码审查、自动化测试、多步工具调用)尤其友好。Lightning 在 agent 基准上的表现大幅超越上一代,说明英伟达针对这类工作负载做了专门的训练优化。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

目前该模型已提供 BF16 和 NVFP4 两种权重,NVFP4 版本在智能基准上仍保持 24 分,说明低精度量化的质量损失控制得不错,这进一步降低了下游部署的硬件门槛。模型采用 OpenMDW-1.1 宽松许可,支持百万 token 上下文,并通过 DeepInfra、Fireworks、FriendliAI、CoreWeave、Nebius、Crusoe 等多家服务商提供 serverless 推理,开发者无需自建 GPU 集群即可快速接入。对于普通用户,短期内最大感知变化可能来自 API 定价下调,或在同样价格下获得更快的响应速度。

值得关注的后续

目前公开信息显示,Lightning 已开放权重和推理服务,但有几件事值得继续跟踪:一是社区实际使用中,NVFP4 版本在长上下文和复杂 agent 任务上的表现是否真如基准测试那样接近 BF16 版本;二是这一速度优势能否转化为商业上稳定的低价 API 供给,还是会因推理需求激增而出现排队或限流;三是 Qwen、Meta 是否会针对“效率竞争”调整自己的小模型策略,尤其是 Meta 的 Muse Glimmer 已在该尺寸区间占据智能领先位置。英伟达的路线能否跑通,最终还得看开发者是否愿意为速度放弃几个百分点的智能分数。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注