据报OpenAI首款定制芯片“Jalapeño”推理基准测试胜过Nvidia Blackwell和Rubin

OpenAI 自研的首款推理芯片“Jalapeño”在 Hot Chips 大会上公布了首批基准测试成绩,据称在每瓦吞吐量和响应延迟上超过英伟达 Blackwell 和 Rubin 平台。尽管芯片仍未量产,但这一结果首次将 OpenAI 从“买算力”推向了“定义算力”的位置。

一句话看懂:OpenAI 自研的首款推理芯片“Jalapeño”在 Hot Chips 大会上公布了首批基准测试成绩,据称在每瓦吞吐量和响应延迟上超过英伟达 Blackwell 和 Rubin 平台。尽管芯片仍未量产,但这一结果首次将 OpenAI 从“买算力”推向了“定义算力”的位置。

事件核心:发生了什么

在 Hot Chips 会议上,OpenAI 展示了其与博通联合开发的首款自研推理芯片“Jalapeño”。该芯片仅负责 AI 推理,不涉及模型训练,且并非针对 OpenAI 自家模型优化,而是通用的大语言模型推理加速器。

根据 SemiAnalysis 公开的 InferenceX 基准测试结果,OpenAI 提供数据并允许部分测试在实验室现场验证。测试覆盖 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T 三款模型。Jalapeño 在峰值吞吐时每瓦特完成的 AI 工作量是英伟达 Blackwell 的 1.5 至 1.9 倍,端到端延迟降低了 1.7 至 3.6 倍;交互式工作负载性能为现有最佳商用系统的 2.1 至 4.1 倍。在 GPT-OSS 上,Jalapeño 达到约每秒每用户 1400 tokens;在 Deepseek R1 上,单并发请求下每秒输出超过 700 tokens。

值得一提的是,Jalapeño 未使用多 token 预测(multi-token prediction)或投机解码(speculative decoding)等优化技术,而部分对比系统使用了这些手段。SemiAnalysis 指出,更公平的对比对象应是同样使用 HBM4 内存的英伟达 Vera Rubin 平台,即使在该对比下,Jalapeño 的每兆瓦输出 token 数仍略高,但按每 token 总拥有成本计算,两者基本持平。

OpenAI 表示,芯片从首次设计到完成蓝图进入工厂约用了 9 个月,整体从 2024 年年中启动到 2025 年 11 月送厂耗时约 16 个月。开发过程中使用了 OpenAI 自家模型辅助芯片设计与编程优化。

为什么重要

这一消息的核心意义在于,它动摇了“英伟达 CUDA 生态不可替代”的行业共识。SemiAnalysis 发文称“CUDA 护城河可能已死”,理由是 OpenAI 能够在自有硅片上如此快速地适配新模型。Jalapeño 从设计到送厂仅用 9 个月,这种迭代速度在芯片行业极为罕见,且依赖的是 OpenAI 自身的大模型来加速硬件开发。

如果量产后性能属实,意味着 AI 算力供应链将从“买 GPU”转向“定义芯片”,英伟达、AMD、AWS 等厂商与 OpenAI 之间既合作又竞争的关系将更加复杂。英伟达、AMD、AWS 均是 OpenAI 的投资方或算力合作伙伴,且各自也在自研 AI 芯片。

不过,目前公开信息显示,Jalapeño 仍处于工程样品阶段,而英伟达 Rubin 平台已开始向客户出货。此外,英伟达和 AMD 已发布基于更大模型(如 Deepseek V4 Pro、Kimi K3)的测试结果,但 Jalapeño 尚未在这些模型上验证。

对用户/开发者/创作者的影响

短期来看,普通用户和开发者不会直接感知到 Jalapeño 的存在,因为该芯片尚未量产,且 OpenAI CFO Sarah Friar 称它将补充而非替代现有英伟达、AMD、AWS、Cerebras、CoreWeave 等合作伙伴的算力资源。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

中期而言,如果 Jalapeño 按基准数据落地,AI 推理成本可能显著下降,这会影响 API 定价策略。开发者和企业用户有望看到更便宜的 token 价格或更快的响应速度。视频生成、图像生成、代码助手、Agent 应用等对推理延迟敏感的 AI 应用体验也可能改善。

对创作者和开发者而言,更值得关注的是 OpenAI 能否将芯片优势转化为开放能力——例如通过 API 或开发者平台向外部提供更低延迟的推理服务,而非仅用于内部模型运行。

值得关注的后续

以下是三个观察点:

第一,Jalapeño 何时进入量产并实际部署到 OpenAI 的数据中心,以及首批部署规模有多大,这将验证基准数据在真实负载下是否成立。

第二,英伟达 Vera Rubin 平台在同等测试条件下的完整性能数据,尤其在大模型和长上下文场景中的对比,目前双方测试条件并不完全对等。

第三,OpenAI 是否会将该芯片与自身模型深度绑定,形成“模型+芯片”的闭环优势,还是继续作为通用推理加速器向外部生态开放,这将影响整个 AI 算力市场的竞争形态。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 20314

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注