Jalapeño’s first results show industry-leading speed and efficiency in AI inference

OpenAI 自研推理芯片 Jalapeño 公布首批测试结果,在功耗、延迟和吞吐量上同时优于现有商用系统,意味着 AI 推理性能的竞争从“堆芯片”转向了“全栈协同设计”。

一句话看懂:OpenAI 自研推理芯片 Jalapeño 公布首批测试结果,在功耗、延迟和吞吐量上同时优于现有商用系统,意味着 AI 推理性能的竞争从“堆芯片”转向了“全栈协同设计”。

事件核心:发生了什么

OpenAI 于 2026 年 8 月 25 日公布了其首款自研推理芯片 Jalapeño 的实测数据。结果显示,在 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 三款公开模型上,Jalapeño 在峰值吞吐下每瓦特可完成的工作量比对比系统提升 1.5 至 1.9 倍,端到端延迟降低 1.7 至 3.6 倍;在高交互性负载场景下,性能提升达 2.1 至 4.1 倍。测试基于 SemiAnalysis 发布的 InferenceX 公开基准,对比对象为当前市售的主流 AI 加速系统。Jalapeño 额定功耗为 700 瓦,但在测试负载中实测持续功耗不超过 550 瓦。

为什么重要

Jalapeño 的关键突破在于同时解决了吞吐量和延迟的矛盾——传统硬件架构往往需要在两者之间取舍,而 Jalapeño 通过将芯片、内存、网络、软件和机架级系统围绕真实语言模型负载进行一体化设计,避免了数据搬运和通信延迟带来的算力闲置。更重要的是,这一结果展示了 OpenAI 在自研芯片路线上的实际进展:从模型设计、产品开发到推理服务的全栈协同,使得每瓦特性能持续领先。OpenAI 在内部测试中发现,模型规模越大、负载越复杂,Jalapeño 的优势越明显,这暗示该架构对未来更大规模模型和智能体任务具有更强的适配能力。

对用户/开发者/创作者的影响

对于使用 OpenAI API 的开发者而言,Jalapeño 带来的直接收益是更快的响应速度和更稳定的服务可用性——尤其是需要多步骤连续推理的智能体应用,延迟累积效应将被显著缓解。高性能推理意味着相同算力成本下可以服务更多请求,长期看可能推动 API 价格下降或让更高规格模型(如 1T 参数级模型)的使用门槛降低。对于企业采购方,Jalapeño 的每瓦特性能提升也意味着数据中心运营成本有望缩减。需要注意的是,Jalapeño 目前主要服务于 OpenAI 自有产品的推理环节,尚未开放第三方采购或云服务接入。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

接下来值得观察三个方向:一是 Jalapeño 何时从测试阶段进入大规模生产部署,以及其实际服务是否会优先开放给 ChatGPT 付费用户或 API 开发者;二是 OpenAI 是否会公布 Jailapeño 在自有前沿模型(如 GPT 系列)上的更多跑分数据,以验证其“更大模型优势更大”的判断;三是其他 AI 芯片厂商(如英伟达、AMD 以及谷歌 TPU 团队)是否会调整产品路线,或在推理效率指标上给出对标的回应。目前公开信息显示,Jalapeño 是未来多代际硬件平台的第一代产品,后续迭代节奏和产能规模尚待披露。

来源:OpenAI News

celebrityanime
celebrityanime
文章: 20262

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注