一句话看懂:NVIDIA 公布 Nemotron 3 Ultra 模型在 NIM 全栈优化后的推理测试结果,在 4 张 B200 上系统吞吐从 718 tok/s 提升到 1997 tok/s,同一交互延迟下可支撑约 2.5 倍并发用户。
事件核心:发生了什么
NVIDIA 在开发者博客中披露了一组针对 Nemotron 3 Ultra(550B 总参数、A55B 激活)的推理基准:硬件为 4 张 B200,任务设定为智能体(Agentic)场景——64K 输入、400 输出、76% KV 缓存复用、每用户 50 TPS 且单 token 间隔 20ms。在关闭 NIM 优化的开源基线上,系统输出吞吐为 718 tok/s;启用 NIM 2.0.12 优化栈后达到 1997 tok/s,约为基线的 2.5 倍。官方强调,这一增益来自精度与自动调优内核、张量并行与专家并行、前缀缓存与部分前缀匹配、Mamba 状态缓存、调度与批处理调参、以及 MTP 投机解码等多项配置的联合作用,并非单项开关叠加。
为什么重要
这组数据的真正价值不在“更快”,而在“同样延迟下能服务更多并发用户”。对智能体类 AI 应用来说,提示长、上下文反复复用、响应流式输出是常态,吞吐和交互性的矛盾比普通对话更突出。NIM 把模型感知与 GPU 感知的调优打包成可部署微服务,并提供经认证的推理栈更新、CVE 处理和企业支持,等于把“性能工程 + 生产运维”一起交付。这既强化了 NVIDIA 在推理栈上的软硬件协同优势,也让开源模型的实际部署成本结构更依赖其工具链。
对用户/开发者/创作者的影响
对开发者和企业团队而言,最直接的变化是:不必从空白运行时开始调参,可以拿已验证的 NIM 配置做起点,再用自己的真实流量做基准测试。NVIDIA 建议固定使用 NIM 2.0.12 或更新版本的镜像 tag/digest,用 Mooncake 格式 JSONL 回放代表性请求,并通过 AIPerf 生成 Pareto 曲线,选择满足 SLO 的吞吐点。对普通用户和创作者,这意味着同等的 GPU 预算可能支撑更多并发会话,智能体应用的响应速度和可用性有改善空间,但实际效果仍取决于具体流量结构。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 NIM 2.0.12 之后的版本是否继续拉开吞吐差距,以及 MTP 投机解码在不同接受率下的实际收益。二是竞品推理栈是否跟进类似的智能体场景 Pareto 基准,形成可比口径。三是开发者能否在自有业务流量上复现 2.5 倍量级,若不能,瓶颈会落在哪里。目前公开信息显示,官方曲线只是起点,并非对所有应用的结果承诺。


