Nvidia says its Groq 3 LPX is four times faster than Cerebras, but the math is more complicated

英伟达宣布 Groq 3 LPX 推理加速卡进入全面量产,并在独立测试中跑出每秒 3400 token 的速度,号称是 Cerebras 的四倍。但考虑到实现这一成绩需要至少 64 颗芯片,而 Cerebras 只需一两颗,这场速度之争实际并不像数字看起来那么悬殊。

一句话看懂:英伟达宣布 Groq 3 LPX 推理加速卡进入全面量产,并在独立测试中跑出每秒 3400 token 的速度,号称是 Cerebras 的四倍。但考虑到实现这一成绩需要至少 64 颗芯片,而 Cerebras 只需一两颗,这场速度之争实际并不像数字看起来那么悬殊。

事件核心:发生了什么

在 Hot Chips 2026 会议上,英伟达宣布其 Groq 3 LPX 推理加速器进入全面生产阶段,预计今年晚些时候上线。这款芯片定位为“交互式 AI 推理加速器”,隶属于 Vera Rubin 平台,专门用于加速 AI 智能体的 token 生成速度。英伟达在去年 12 月以约 200 亿美元收购了 Groq 的授权,并引入了创始人 Jonathan Ross 和总裁 Sunny Madra。

根据 Artificial Analysis 的基准测试,在开源模型 Gemma 4 31B 上,使用 10 万 token 上下文窗口,Groq 3 LPX 机架实现了每秒 3400 token 的输出速度,这是该模型目前公开记录的最高值。英伟达称这一成绩是 Cerebras 芯片(每秒 882 token)的四倍。

为什么重要

这次对比背后是推理加速器市场两种技术路线的直接碰撞。Groq 采用 SRAM 密集型数据流架构,每颗 LPU 仅有 500 MB 内存,相比 Rubin GPU 的 288 GB 差了 576 倍,因此模型必须拆分到多颗芯片上运行。The Register 指出,Gemma 4 31B 属于最理想的情况——这是一个稠密模型,可以完整放进一个机架;而像 DeepSeek V3 这样的混合专家模型,则需要 1342 颗加速器,也就是超过五个机架。

更重要的是,Cerebras 跑同一个模型只需要一两颗加速器,而英伟达的方案至少需要 64 颗芯片。这意味着英伟达引用的“四倍速度”没有把硬件成本和部署规模纳入比较,也没有包含 Cerebras 最新的 CS-4 代产品。对行业而言,这个案例提醒我们:推理性能的单点指标,如果脱离芯片数量和系统总成本来看,容易形成误导。

对用户/开发者/创作者的影响

对于开发者和企业用户来说,Groq 3 LPX 如果真的能够把代码编写任务从“小时级”压缩到“分钟级”,在智能体场景下会有实际价值——模型可以在用户可接受的等待时间内完成更多推理步骤、调用更多工具、验证更多结果。Nebius 计划通过其 Token Factory 成为首家提供该芯片的云服务商,Groq 自身也是早期用户之一。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

但实际使用中,开发者需要关注的是总体拥有成本:达到宣称速度所需的最小部署规模、多机架方案带来的网络开销,以及在混合专家模型上的表现是否会大幅缩水。目前公开信息显示,这些方面尚无充分验证。

值得关注的后续

接下来可以重点观察三点:第一,Groq 3 LPX 在 Nebius 平台上线后的实际定价和可用性,以及是否对 Cerebras 形成价格压力;第二,该架构在 DeepSeek V3 这类大规模混合专家模型上的真实表现如何,是否会暴露扩展性短板;第三,Cerebras 是否会公布 CS-4 的对比数据来回应英伟达的“四倍”说法,推动行业内形成更透明的推理性能评测标准。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 20228

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注