OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show

OpenAI 在 Hot Chips 会议上首次公布了自研推理芯片 Jalapeño 的基准测试成绩,显示其在每千瓦吞吐量和每位用户 Token 数上优于当前英伟达 Blackwell 系统,但量产要到 2026 年底才小规模开始。

一句话看懂:OpenAI 在 Hot Chips 会议上首次公布了自研推理芯片 Jalapeño 的基准测试成绩,显示其在每千瓦吞吐量和每位用户 Token 数上优于当前英伟达 Blackwell 系统,但量产要到 2026 年底才小规模开始。

事件核心:发生了什么

在 2026 年 8 月 25 日举行的 Hot Chips 会议上,OpenAI 硬件负责人 Richard Ho 公开了自研推理芯片 Jalapeño 的首批基准测试结果。该芯片由 OpenAI 与博通(Broadcom)合作开发,OpenAI 自有模型参与了设计过程。测试基于 SemiAnalysis 的 InferenceX 基准,结果显示 Jalapeño 在每用户 Token 数、每千瓦吞吐量两项指标上均超过当前可用的英伟达 Blackwell 系统,同时延迟也更低。Richard Ho 在媒体电话会上表示,Jalapeño 能在更少功耗下服务更多 AI 推理任务,并兼顾低延迟。

值得注意的是,这一比较对象是现有 Blackwell 系统,而待到 Jalapeño 实际部署时,竞品可能已大幅升级。Richard Ho 估计,Jalapeño 将于 2026 年底以“非常小的规模”开始部署,2027 年才会有更显著的放量。

为什么重要

Jalapeño 是 OpenAI 从模型公司向算力自研方向迈出的实质一步。芯片针对推理阶段的 prefill(预填充)和通信环节做了专门优化,这两个阶段通常被视为推理性能的瓶颈。OpenAI 在官方博客中称,设计目标是“最小化数据移动和通信延迟”,让模型状态(包括生成响应时使用的 KV 缓存)在推理过程中保持本地化,并根据每个推理阶段动态调配计算、内存和网络资源。

这一做法背后的思路是“全栈协同”:芯片、模型、产品和内存同步迭代,而非像传统模式那样在不同厂商的芯片上适配已有模型。目前公开信息显示,Jalapeño 计划做成多代际平台,OpenAI 宣称这能使推理效率和控制力都高于依赖外部硬件方案。

对行业竞争格局而言,Jalapeño 的基准成绩说明英伟达在推理市场并非没有对手,但 OpenAI 并未给出与下一代竞品(如 Rubin 架构)的对比数据,其实际竞争力仍待验证。

对用户/开发者/创作者的影响

目前公开信息显示,Jalapeño 不直接面向普通用户销售,短期内不会改变个人用户的 API 调用方式。但对开发者和企业客户而言,若该芯片在 2027 年如期规模化部署,OpenAI 的 API 推理成本有望下降,单位算力可服务的请求数增加,意味着更低的 token 价格或更快的响应速度。对依赖 OpenAI API 构建应用的开发团队,这可能在成本结构上带来实质变化。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和终端用户而言,Jalapeño 带来的低延迟优化可能体现在 ChatGPT 等产品的多轮对话体验上,尤其是长上下文和复杂推理场景中的等待时间缩短。但其效果要到实际部署后才能评估。

值得关注的后续

第一,Jalapeño 的“小规模部署”具体落在哪个时间点和哪个产品线,是否率先用于 ChatGPT 或 API 服务,值得持续跟踪。

第二,英伟达下一代平台的性能进展是关键变量。若 Blackwell 后续架构在推理效率上大幅提升,Jalapeño 当前的基准优势可能被稀释。

第三,博通与 OpenAI 的合作模式是否扩展到更多芯片品类,以及该平台对开发者生态(如推理框架兼容性)的支持程度,将影响其能否真正替代现有方案。

来源:TechCrunch AI

celebrityanime
celebrityanime
文章: 20239

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注