一句话看懂:OpenRouter 发布解读文章,介绍 NVIDIA 于 2026 年 8 月 11 日推出的 Nemotron 3.5 Lightning——一款 30B 总参数、3B 激活参数的 MoE 开源模型,专门承担 Agent 工作流中高频、低难度的执行调用。它把「规划」和「执行」拆给不同模型,意图降低长链路 Agent 的综合成本与延迟。
事件核心:发生了什么
根据 OpenRouter 9 月 22 日的解读,Nemotron 3.5 Lightning 采用混合架构:交错的 Mamba-2、MoE 与部分注意力层,支持可配置推理,并附带多 token 预测、DSpark 与 DFlash 两个投机解码草稿模型,以及面向推理优化的 NVFP4 权重。许可为 OpenMDW-1.1,开源 BF16 参考权重及 GGUF 版本。
在 OpenRouter 上,它提供标准版(各供应商统一 262,144 token 上下文,部分完成上限 32,768 至 235,929 token)与免费版(最高 100 万 token 上下文、65,536 完成 token)。标准版在四家供应商均列出结构化输出,工具调用仅两家列出;免费版两者均未列出。模型 ID 为 nvidia/nemotron-3.5-lightning 与 nvidia/nemotron-3.5-lightning:free。
为什么重要
Agent 的调用结构通常是「一次难规划 + 几十次易执行」:读文件、选工具、校验结果、决定下一步。NVIDIA 把 Lightning 定位在这一执行层,与 550B 总参数、55B 激活的 Nemotron 3 Ultra 形成分工,后者面向复杂推理与编排。这反映出模型厂商开始按 Agent 工作流的环节分层设计,而非只堆单一旗舰模型。
30B-A3B 的稀疏设计让模型保留较大总容量,同时把每 token 计算压到约 3B 激活量级,直接对应高频调用的吞吐需求。不过 OpenRouter 也提醒,激活参数不等于完整算力或显存规格,共享层仍需运行,实际硬件要求取决于精度、上下文、推理引擎和批处理策略。
对开发者与创作者的影响
对做长链路 Agent 的开发者,Lightning 适合「目标明确、上下文足够、需要调用工具或返回结构化数据」的步骤。典型架构是先用大模型规划,再把逐个执行步骤交给 Lightning,以控制整轮运行的延迟和成本。开放权重也让企业可按领域定制或本地部署。
但选型时需注意两点:目前公开信息显示,标准版仅部分供应商支持工具调用,免费版未列出工具调用与结构化输出;若你的流程依赖这两项能力,应先在 OpenRouter 模型页确认具体端点,再决定是否围绕它设计。
值得关注的后续
一是各家供应商的工具调用支持是否补齐;二是完成 token 上限跨度较大,实际长任务表现需实测;三是 Ultra 与 Lightning 的「规划—执行」分工是否会成为 Agent 架构的常见范式,以及推理价格与吞吐随竞争如何变化。



