加速 GPT-5.6 Sol 超快版

Cerebras 与 OpenAI 合作推出 GPT-5.6 Sol 的 Ultrafast 超快推理模式,在 OpenAI API 中首批上线,最高可输出 750 tokens/秒,且不牺牲模型质量。

一句话看懂:Cerebras 与 OpenAI 合作推出 GPT-5.6 Sol 的 Ultrafast 超快推理模式,在 OpenAI API 中首批上线,最高可输出 750 tokens/秒,且不牺牲模型质量。

事件核心:发生了什么

8 月 13 日,Cerebras 官方博客宣布与 OpenAI 合作,为 GPT-5.6 Sol 提供名为 Ultrafast Mode 的新服务层级,首批通过 OpenAI API 向部分客户开放,后续逐步扩大范围。Cerebras 的晶圆级芯片(Wafer-Scale Engine)为这一模式提供算力支撑,将 44 GB SRAM 集成在单颗晶圆上,模型权重无需频繁在片内外搬运,从而绕过 GPU 上常见的显存带宽瓶颈。

官方公布的数据显示,Ultrafast 模式下 GPT-5.6 Sol 的输出速度最高达 750 tokens/秒,比 Anthropic 的 Claude Fable 5 快 11 倍,比 Opus 4.8 的 Fast 模式快 5 倍(数据来源为 Artificial Analysis 的对比测试)。在 Humanity’s Last Exam(HLE)基准上,Sol Ultrafast 用 11 小时 11 分钟完成全部 2,500 道题,Claude Fable 5 耗时 78 小时 27 分钟,准确率相近,耗时缩短约 7 倍。在面向经济知识工作的 GDP-Val 基准中,Ultrafast 实现了 5.6 倍端到端加速,质量没有下降。

为什么重要

长期以来,大模型应用需要在“快”和“聪明”之间做取舍:模型越强,推理越慢。Cerebras 和 OpenAI 这次合作的核心价值,是用硬件架构创新打破这一权衡——不靠蒸馏或降精度换速度,而是通过减少推理过程中的数据搬运来提速。这意味着 AI 产品可以在不损失智力水平的前提下,把高推理任务的响应时间压到接近实时,AI Agent 才有可能真正进入生产系统的关键路径,而不是只做离线批处理。对 Cerebras 而言,这是一次从特定领域走向主流模型生态的关键落地。

对用户/开发者/创作者的影响

对于通过 OpenAI API 开发应用的团队,Ultrafast 意味着原本需要等待数分钟的高强度推理任务,可以在注意力转移前就返回结果。开发者可以将它用于配置风险更高、时效要求更严的场景,比如线上服务故障排查、安全威胁响应、法律文书起草、财务建模和复杂代码生成;同时保留标准模式处理可以并行化的常规任务,在成本与速度之间做灵活分配。目前该模式仅对首批受邀客户开放,普通用户和中小开发者还需要等待 OpenAI 逐步放量。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,Ultrafast 的定价策略尚未公布,速度优势能否转化为可负担的 API 成本,是开发者是否愿意迁移的关键。其次,Cerebras 是独家算力供应商还是长期合作伙伴,以及产能能否支撑大规模并发调用,值得观察。第三,Anthropic、Google 等对手是否会跟进类似的高速推理方案,将直接影响这一细分市场的竞争格局。目前公开信息显示,Cerebras 的容量扩展时间和 OpenAI 的开放节奏都还没有明确时间表。

来源:www.cerebras.ai

celebrityanime
celebrityanime
文章: 18352

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注