一句话看懂:智谱借 GLM-5 系列实现 ARR 短期翻倍,并加速补齐 Infra(基础设施)效率短板;在大模型能力趋同后,推理效率正成为决定下一轮 AI 公司商业竞争力的关键战场。
事件核心:发生了什么
《晚点 LatePost》披露了智谱近期的一系列关键数据:2026 年 2 月初 GLM-5 发布前,智谱 ARR(年度经常性收入)约为 1 亿美元,发布后短期内实现翻倍;今年以来 ARR 整体增长 15 倍。智谱 MaaS 开放平台注册用户(即 API 用户)已接近 700 万,较 7 月初增加约 200 万,其中包括 2.3 万家企业客户;对标 Codex 的开发者产品 ZCode 上线 1 个月用户突破百万。
这一增长并非孤例。Anthropic 年化收入在 2025 年底为 90 亿美元,半年后增长到 500 亿美元,SemiAnalysis 测算其 7 月已超过 600 亿美元。编程场景需求的爆发,加上持续发布领先模型,是共同驱动力。在国内,月之暗面 7 月 16 日发布 Kimi K3 后,次日 API 因过载中断近 6 小时并暂停新用户注册;阿里 8 月 3 日发布 2.4 万亿参数的 Qwen3.8-Max,港股当天上涨 7%。
算力受限背景下,智谱过去半年重点补课 Infra 效率:完成对中科加禾的收购,与 TileRT 团队合作推出高速版 API(每秒生成 400 token,约为常规服务的 8 倍),并发布 ZCube 推理网络架构方案,宣称可提升生产集群吞吐量最高 15%,同时降低交换机与光模块需求约三分之一。
为什么重要
“先进模型发布拉动收入”这一剧本在中美两国都已经跑通,但模型能力趋同之后,谁能用同样的算力跑出更多 token,谁的商业模式就更健康。目前公开信息显示,除了训练更强的模型,智谱等公司正把大量工程精力投向推理效率:GLM-5.2 在 20 万 token 上下文长度下的吞吐能力,相比 GLM-5.1 提升约 70%(以各自处理 3.2 万 token 时为基准);其核心架构改动——如 IndexShare 复用稀疏注意力层索引、改进 MTP 草稿层——都在围绕降低推理成本设计。后训练阶段采用 PPO 与 SAO 异步优化方法,行业常见方法约 160 步即崩溃,该方案稳定训练了 1000 步。
Infra 层优化正在成为投资人眼中未来一两年 AI 投资的重要主题,有投资人向《晚点 LatePost》表示,1% 的效率提升放在大规模算力部署中,节省的成本就是天文数字。与此同时,Kimi K3 选择了更激进的“线性注意力”路线,将四分之三注意力层改为有损近似,以换取缓存体积和吞吐能力的显著改善。两条技术路线谁更可持续,将直接影响下一代模型的产品形态。
对用户/开发者/创作者的影响
对开发者而言,API 的吞吐能力和速度直接决定应用成本和体验。智谱高速版 API 把生成速度推到 400 token/s,配合长上下文场景下的吞吐优化(一个 Agent 任务平均需处理 7 万多 token),意味着更低的单位调用成本和更流畅的 Agent 应用开发体验。对企业用户来说,2.3 万家企业客户接入 MaaS 平台,说明通过 API 调用而非私有化部署获取模型能力,仍是大规模落地的主流路径;而推理效率提升带来的降价空间,可能继续压低 AI 应用的调用成本。对创作者和普通用户,这些变化更多体现为模型响应更快、长文档处理更稳,以及更多基于编程和 Agent 场景的 AI 产品出现。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,智谱收购中科加禾、与 TileRT 团队的合作能否持续产出可量化的 Infra 效率提升,以及这种提升能否在 GLM-5 后续版本中稳定转化为 API 降价或速度优势;第二,Kimi K3 和阿里 Qwen3.8-Max 发布后,竞争压力是否会让智谱的 ARR 增速放缓,还是反向倒逼其进一步拉开效率差距;第三,TileRT 在介绍合作时提到的“模型、编译器与硬件重新耦合”是否会有更多落地方案,这可能影响未来国产算力生态的走向。

![组织如何使用AI:来自ChatGPT的证据 [pdf]](https://www.chat-gpts.plus/wp-content/uploads/2026/08/ai_cover_3-382-768x403.jpg)
