智谱发布 GLM-5.3-FlashX:速度飙至200tokens/s,国产算力再提速

智谱 AI 在 BigModel 平台上线 GLM-5.3-FlashX,最高输出速度达到 200 tokens/s,在保持原有智能水平和低价的前提下大幅提速,面向企业和开发者提供高吞吐、低延迟的推理服务。

一句话看懂:智谱 AI 在 BigModel 平台上线 GLM-5.3-FlashX,最高输出速度达到 200 tokens/s,在保持原有智能水平和低价的前提下大幅提速,面向企业和开发者提供高吞吐、低延迟的推理服务。

事件核心:发生了什么

智谱 AI 已在其 BigModel 平台正式发布 GLM-5.3-FlashX 大模型,对应 API 同步上线。相比上一代 GLM-5.3-Flash,新版本的最高输出速度提升至 200 tokens/s,官方强调其卖点是“智能、价格、速度”三项兼顾。

值得注意的是,GLM-5.3-Flash 此前曾以“Ox Alpha”的匿名身份在海外出现,凭借同尺寸下较强的智能表现和性价比积累了不少使用量。为了承接持续增长的调用需求,智谱依托 10 万卡规模的国产芯片算力底座,加大推理优化投入,最终推出增强版 FlashX。开发者可通过官方 API 文档接入,非技术用户也能在体验中心直接试用。

为什么重要

这次升级的重点不在参数规模,而在推理效率。200 tokens/s 的输出速度意味着在高并发场景下,单位时间能服务更多请求,直接关系到企业的调用成本和响应体验。对 API 业务而言,推理速度与单 token 价格往往比“跑分”更能决定客户是否长期留存。

另一个信号是算力路线。原文明确提到该模型依托 10 万卡国产芯片算力底座完成推理优化,这对关注国产算力落地进展的人来说是一个可核实的案例——大模型厂商正把训练之外的推理环节,作为国产芯片规模化应用的切入口。

对用户/开发者/创作者的影响

对开发者来说,FlashX 的价值在于高并发、低延迟场景,例如实时对话、Agent 工作流、批量内容生成等对首字延迟和持续输出速度敏感的应用。API 已就绪,接入门槛与上一代基本一致,迁移成本主要看接口兼容性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对内容创作者和普通用户,体验中心提供了免代码试用入口,可以直观感受生成速度差异。对企业采购方,判断点则是:速度提升之后,实际价格是否维持原有区间。原文称 FlashX“保持原有智能水平与可接受定价”,但未给出具体费率,目前公开信息显示,具体价格仍需以 BigModel 平台页面为准。

值得关注的后续

一是 API 定价与限流策略是否公布更细的档位,这决定它能否真正吃下高并发商业场景;二是 200 tokens/s 是峰值还是稳定可用速度,长文本、多轮对话下的实测表现更值得跟踪;三是同类厂商是否会跟进提速,推理效率正成为大模型竞争的新指标。

来源:AIbase

celebrityanime
celebrityanime
文章: 24209

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注