算力受限,但 Infra 效率还有很大的提升空间 ARR 迅猛增长受益于编程场景需求的快速攀升和前沿模型的强大引力。作为对比,智谱 2026 年 2 月初 GLM-5 模型发布前 ARR 约为 1 亿美元左右,根据《晚点 LatePost》了解,GLM-5 发布后智谱 ARR 在短期内即实现翻倍。根据 Artificial Analysis 的评测,GLM-5 发布时位居全球第四,仅次于 Claude 当时最先进的两款模型以及 Ope…

智谱借 GLM-5 系列实现 ARR 短期翻倍,并加速补齐 Infra(基础设施)效率短板;在大模型能力趋同后,推理效率正成为决定下一轮 AI 公司商业竞争力的关键战场。

一句话看懂:智谱借 GLM-5 系列实现 ARR 短期翻倍,并加速补齐 Infra(基础设施)效率短板;在大模型能力趋同后,推理效率正成为决定下一轮 AI 公司商业竞争力的关键战场。

事件核心:发生了什么

《晚点 LatePost》披露了智谱近期的一系列关键数据:2026 年 2 月初 GLM-5 发布前,智谱 ARR(年度经常性收入)约为 1 亿美元,发布后短期内实现翻倍;今年以来 ARR 整体增长 15 倍。智谱 MaaS 开放平台注册用户(即 API 用户)已接近 700 万,较 7 月初增加约 200 万,其中包括 2.3 万家企业客户;对标 Codex 的开发者产品 ZCode 上线 1 个月用户突破百万。

这一增长并非孤例。Anthropic 年化收入在 2025 年底为 90 亿美元,半年后增长到 500 亿美元,SemiAnalysis 测算其 7 月已超过 600 亿美元。编程场景需求的爆发,加上持续发布领先模型,是共同驱动力。在国内,月之暗面 7 月 16 日发布 Kimi K3 后,次日 API 因过载中断近 6 小时并暂停新用户注册;阿里 8 月 3 日发布 2.4 万亿参数的 Qwen3.8-Max,港股当天上涨 7%。

算力受限背景下,智谱过去半年重点补课 Infra 效率:完成对中科加禾的收购,与 TileRT 团队合作推出高速版 API(每秒生成 400 token,约为常规服务的 8 倍),并发布 ZCube 推理网络架构方案,宣称可提升生产集群吞吐量最高 15%,同时降低交换机与光模块需求约三分之一。

为什么重要

“先进模型发布拉动收入”这一剧本在中美两国都已经跑通,但模型能力趋同之后,谁能用同样的算力跑出更多 token,谁的商业模式就更健康。目前公开信息显示,除了训练更强的模型,智谱等公司正把大量工程精力投向推理效率:GLM-5.2 在 20 万 token 上下文长度下的吞吐能力,相比 GLM-5.1 提升约 70%(以各自处理 3.2 万 token 时为基准);其核心架构改动——如 IndexShare 复用稀疏注意力层索引、改进 MTP 草稿层——都在围绕降低推理成本设计。后训练阶段采用 PPO 与 SAO 异步优化方法,行业常见方法约 160 步即崩溃,该方案稳定训练了 1000 步。

Infra 层优化正在成为投资人眼中未来一两年 AI 投资的重要主题,有投资人向《晚点 LatePost》表示,1% 的效率提升放在大规模算力部署中,节省的成本就是天文数字。与此同时,Kimi K3 选择了更激进的“线性注意力”路线,将四分之三注意力层改为有损近似,以换取缓存体积和吞吐能力的显著改善。两条技术路线谁更可持续,将直接影响下一代模型的产品形态。

对用户/开发者/创作者的影响

对开发者而言,API 的吞吐能力和速度直接决定应用成本和体验。智谱高速版 API 把生成速度推到 400 token/s,配合长上下文场景下的吞吐优化(一个 Agent 任务平均需处理 7 万多 token),意味着更低的单位调用成本和更流畅的 Agent 应用开发体验。对企业用户来说,2.3 万家企业客户接入 MaaS 平台,说明通过 API 调用而非私有化部署获取模型能力,仍是大规模落地的主流路径;而推理效率提升带来的降价空间,可能继续压低 AI 应用的调用成本。对创作者和普通用户,这些变化更多体现为模型响应更快、长文档处理更稳,以及更多基于编程和 Agent 场景的 AI 产品出现。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,智谱收购中科加禾、与 TileRT 团队的合作能否持续产出可量化的 Infra 效率提升,以及这种提升能否在 GLM-5 后续版本中稳定转化为 API 降价或速度优势;第二,Kimi K3 和阿里 Qwen3.8-Max 发布后,竞争压力是否会让智谱的 ARR 增速放缓,还是反向倒逼其进一步拉开效率差距;第三,TileRT 在介绍合作时提到的“模型、编译器与硬件重新耦合”是否会有更多落地方案,这可能影响未来国产算力生态的走向。

来源:@latepostnews

celebrityanime
celebrityanime
文章: 18318

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注