NVIDIA Groq 3 LPX 的确定性执行如何为 NVIDIA Vera Rubin 上的高能效高交互推理提供动力

NVIDIA 为 Vera Rubin AI 平台引入 Groq 3 LPX 低延迟加速器,靠确定性执行模型把功耗管理精确到时钟周期,让高交互推理在同样电力预算下跑出更多有效算力。

一句话看懂:NVIDIA 为 Vera Rubin AI 平台引入 Groq 3 LPX 低延迟加速器,靠确定性执行模型把功耗管理精确到时钟周期,让高交互推理在同样电力预算下跑出更多有效算力。

事件核心:发生了什么

NVIDIA 在其开发者博客中介绍了 NVIDIA Vera Rubin 平台的功耗优化思路。核心产品是 NVIDIA Vera Rubin NVL72 机架,定位是在有限电力预算内提升每瓦性能,覆盖从大吞吐训练到小批量高交互推理的负载。工厂层面,NVIDIA DSX MaxLPS 软件可根据负载变化在机架间调度电力,官方称能在同一站点电力范围内多部署最多 40% 的 GPU,并带来 35% 的 token 吞吐提升。机架内部则用电容和 Intelligent Power Smoothing 软件吸收训练与推理的功率尖峰。

针对最高交互层级,平台加入 NVIDIA Groq 3 LPX 作为低延迟加速器。其 LPU 编译器可把数据何时移动到哪个计算单元、何时执行精确到时钟周期,并覆盖整机架 256 颗 LPU 芯片。基于这张执行时间表,系统能预测每一周期的电流需求,从而使用两项技术:Preemptive Power(PEP)提前准备供电,Clock Period Synthesis(CPS)控制电流上升和下降的陡峭程度,最终压缩必须预留的电压安全裕量。

为什么重要

AI 工厂的瓶颈正从单卡算力转向电力。此前行业衡量 AI 平台多强调原始吞吐,但电力受限时,每瓦性能才是真实价值。Groq 3 LPX 的思路不是单纯堆芯片,而是用确定性调度把“电压护带”这块不直接干活的功耗省下来。这属于系统级优化:编译器、供电、机架设计协同,而不是单点硬件升级。对 NVIDIA 而言,这也补上了高交互、长上下文推理这一档位,同时保持对开源和闭源模型的支持。目前公开信息显示,这仍是平台级方案,并非单独售卖的通用加速卡。

对用户/开发者/创作者的影响

对做实时 AI 应用的开发者,高交互推理的延迟和成本直接决定产品体验,比如语音助手、实时 Agent、长上下文问答。若每瓦有效算力提升,云厂商在同等电力下能提供更多推理容量,长期可能传导为 API 价格或可用配额的变化。对自建算力的企业,采购判断会更多看机架级电力设计和 token/W 指标,而非只看峰值 FLOPS。创作者侧影响相对间接,主要体现为支持长上下文的高交互工具响应更快、单位成本更低。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Groq 3 LPX 是否通过云服务或整机形式对外开放,开发者能否实际调用。二是 40% GPU 部署增量和 35% token 吞吐提升在真实负载下的复现情况。三是 AMD、Google TPU 等竞品是否跟进类似的确定性执行加供电协同路线。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 23680

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注