一句话看懂:NVIDIA 公布 Vera Rubin NVL72 在智能体 AI(Agentic AI)工作负载下的实测推理性能,宣称每兆瓦吞吐量最高可达 GB300 NVL72 的 30 倍,每百万 token 成本降低至 1/35。这意味着下一代 AI 工厂有望用同等电力运行更多智能体任务。
事件核心:发生了什么
NVIDIA 于近期发布基于 SemiAnalysis AgentX 工作负载的实测数据,该负载使用录制的真实智能体编码会话,保留上下文增长、工具调用和子智能体生成过程。数据显示,Vera Rubin NVL72 在 DeepSeek V4 Pro 模型上的每兆瓦吞吐量最高可达 GB300 NVL72 的 30 倍,同时每百万 token 成本降低至 GB300 的约 1/35。NVIDIA 同时表示,GB300 NVL72 相比 Hopper 架构在同样负载下每兆瓦吞吐量已提升最高 15 倍。Vera Rubin 的数据尚未包含其 Vera CPU 在工具调用环节的表现,且正等待 SemiAnalysis 评审。
为什么重要
智能体 AI 的 token 消耗模式与传统聊天完全不同。OpenRouter 数据显示,智能体工作负载的 token 用量是简单对话请求的 15 倍——原因是智能体会反复查询数据库、检索新闻、调用子智能体并逐步累积上下文,长上下文处理成为核心瓶颈。NVIDIA 此次数据的意义在于,它提出了一套面向“完整智能体工作流”而非单次推理请求的评测方式,并展示了从 Hopper 到 Blackwell 再到 Rubin 的能耗效率曲线整体上移。对电力受限的 AI 工厂而言,每兆瓦吞吐量直接决定收入,每百万 token 成本直接决定利润率,Vera Rubin 给出的 30 倍能效提升因此具备明确的商业价值。
对用户/开发者/创作者的影响
对于依赖 API 的开发者,更低的每百万 token 成本意味着智能体应用可以运行更多推理步骤而不必过度压缩上下文,或在不增加预算的前提下把长会话的深度和广度扩展数倍;创作者使用 AI 工具进行长文档研究、多轮修改或批量处理时,等待时间和成本均有下降空间。对于企业和云服务商,若 Vera Rubin NVL72 如期落地,硬件采购和扩容决策可能会从“堆卡”转向“堆能效”,并在同等电力预算下通过 DSX MaxLPS 技术多部署最多 40% 的 GPU。目前这些数据为 NVIDIA 早期实测结果,尚待第三方复核,实际交付后的性能表现仍需要观察。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
首先,SemiAnalysis 的评审结果何时完成、是否会修正数据,是判断这组数字可信度的关键;其次,Vera Rubin NVL72 的正式发货时间和初始定价尚未公布,实际落地后 token 成本能否接近 1/35 的水平需要客户环境验证;再次,AMD 或其他芯片厂商是否会针对智能体工作负载推出类似评测框架和能效数据,将影响下一代 AI 基础设施的竞争叙事。


