OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用

OpenRouter 发布解读文章,介绍 NVIDIA 于 2026 年 8 月 11 日推出的 Nemotron 3.5 Lightning——一款 30B 总参数、3B 激活参数的 MoE 开源模型,专门承担 Agent 工作流中高频、低难度的执行调用。它把「规划」和「执行」拆给不同模型,意图降低长链路…

一句话看懂:OpenRouter 发布解读文章,介绍 NVIDIA 于 2026 年 8 月 11 日推出的 Nemotron 3.5 Lightning——一款 30B 总参数、3B 激活参数的 MoE 开源模型,专门承担 Agent 工作流中高频、低难度的执行调用。它把「规划」和「执行」拆给不同模型,意图降低长链路 Agent 的综合成本与延迟。

事件核心:发生了什么

根据 OpenRouter 9 月 22 日的解读,Nemotron 3.5 Lightning 采用混合架构:交错的 Mamba-2、MoE 与部分注意力层,支持可配置推理,并附带多 token 预测、DSpark 与 DFlash 两个投机解码草稿模型,以及面向推理优化的 NVFP4 权重。许可为 OpenMDW-1.1,开源 BF16 参考权重及 GGUF 版本。

在 OpenRouter 上,它提供标准版(各供应商统一 262,144 token 上下文,部分完成上限 32,768 至 235,929 token)与免费版(最高 100 万 token 上下文、65,536 完成 token)。标准版在四家供应商均列出结构化输出,工具调用仅两家列出;免费版两者均未列出。模型 ID 为 nvidia/nemotron-3.5-lightningnvidia/nemotron-3.5-lightning:free

为什么重要

Agent 的调用结构通常是「一次难规划 + 几十次易执行」:读文件、选工具、校验结果、决定下一步。NVIDIA 把 Lightning 定位在这一执行层,与 550B 总参数、55B 激活的 Nemotron 3 Ultra 形成分工,后者面向复杂推理与编排。这反映出模型厂商开始按 Agent 工作流的环节分层设计,而非只堆单一旗舰模型。

30B-A3B 的稀疏设计让模型保留较大总容量,同时把每 token 计算压到约 3B 激活量级,直接对应高频调用的吞吐需求。不过 OpenRouter 也提醒,激活参数不等于完整算力或显存规格,共享层仍需运行,实际硬件要求取决于精度、上下文、推理引擎和批处理策略。

对开发者与创作者的影响

对做长链路 Agent 的开发者,Lightning 适合「目标明确、上下文足够、需要调用工具或返回结构化数据」的步骤。典型架构是先用大模型规划,再把逐个执行步骤交给 Lightning,以控制整轮运行的延迟和成本。开放权重也让企业可按领域定制或本地部署。

但选型时需注意两点:目前公开信息显示,标准版仅部分供应商支持工具调用,免费版未列出工具调用与结构化输出;若你的流程依赖这两项能力,应先在 OpenRouter 模型页确认具体端点,再决定是否围绕它设计。

值得关注的后续

一是各家供应商的工具调用支持是否补齐;二是完成 token 上限跨度较大,实际长任务表现需实测;三是 Ultra 与 Lightning 的「规划—执行」分工是否会成为 Agent 架构的常见范式,以及推理价格与吞吐随竞争如何变化。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:OpenRouter:Announcements(RSS)

celebrityanime
celebrityanime
文章: 24870

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注