NVIDIA Vera Rubin 与 Blackwell 为智能体AI的每瓦性能树立新标准

NVIDIA 发布 Vera Rubin NVL72 的 AgentX 基准测试预览结果,宣称其在智能体 AI 推理场景下每兆瓦 AI 工厂吞吐量比上一代 GB300 NVL72 高出最高 30 倍,同时 Blackwell GB300 NVL72 也保持了对前代产品数量级的能效优势。

一句话看懂:NVIDIA 发布 Vera Rubin NVL72 的 AgentX 基准测试预览结果,宣称其在智能体 AI 推理场景下每兆瓦 AI 工厂吞吐量比上一代 GB300 NVL72 高出最高 30 倍,同时 Blackwell GB300 NVL72 也保持了对前代产品数量级的能效优势。

事件核心:发生了什么

NVIDIA 在其开发者博客中公布了下一代 Vera Rubin NVL72 平台在 SemiAnalysis AgentX 基准测试中的预览数据。AgentX 是 SemiAnalysis 旗下 InferenceX 开源基准套件中专为智能体编码推理设计的测试项,它通过重放真实的 Claude Code 会话轨迹,模拟多轮工具调用、上下文累积和分布式混合专家(MoE)执行等生产环境请求模式。

根据测试数据,Vera Rubin NVL72 在每兆瓦 AI 工厂吞吐量上比 GB300 NVL72 提升最高 30 倍。与此同时,GB300 NVL72 在动态智能体工作负载下,延续了相较 H200 每兆瓦 token 产出量最多 40 倍的优势。传统静态 8K/1K 序列长度测试已被降级为“维护模式”,AgentX 取代其成为衡量推理服务性能的主要场景。

为什么重要

智能体 AI 将推理请求从单轮交互扩展为多步骤工作流,OpenRouter 的 State of AI 报告显示,过去 100 万亿 token 的真实使用中,平均每请求提示词 token 增长约四倍,单一智能体请求消耗的 token 是普通聊天的 15 倍。这意味着算力评测标准必须从固定序列长度转向能反映长上下文预填充、KV 缓存复用、交互式解码和工具调用间隙的复杂场景。

AgentX 的价值在于它不是合成负载,而是重放录制流量,所有系统接受相同输入,差异直接反映服务栈能力而非调优技巧。Vera Rubin NVL72 的预览数据为下一代硬件确立了“每瓦智能体吞吐量”这一新竞争标尺,也侧面说明当前 GB300 在动态工作负载下仍具备较前代的大幅能效优势,这会影响 AI 工厂的采购决策和算力成本结构。

对用户/开发者/创作者的影响

对于 API 调用者而言,AgentX 测试关注的每兆瓦吞吐量与交互性权衡,直接关系到智能体应用的响应速度和单位成本。更高的每瓦 token 产出意味着同等电费下能支撑更多并发会话或更长上下文,不会因工具调用间隔或 KV 缓存压力导致体验下滑。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于企业算力采购方,NVIDIA 提供的测试指标(E2E 归一化交互性、标准交互性、E2E 延迟、TTFT)可作为比较不同硬件服务智能体负载的参考依据,避免仅凭峰值算力或静态测试结果做决策。目前公开信息显示,Vera Rubin NVL72 的 30 倍提升仍是预览数据,有待正式量产后的独立验证。

值得关注的后续

第一,Vera Rubin NVL72 的量产时间表与价格是否与预览性能匹配,若实际提升打折扣或供应链受限,将影响 2026 年前后的 AI 工厂扩容节奏。第二,AMD、Intel 及云厂商自研芯片是否会跟进 AgentX 基准,或推出自定义智能体推理测试,改变当前以 NVIDIA 生态为核心的评测话语权。第三,AgentX 是否会被更多模型厂商采用为标准测试项,以及它能否覆盖多模态智能体和更复杂的子代理协作场景,仍有待观察。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 20025

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注