一句话看懂:AI 编程工具公司 Unblocked 将大部分 Agent 流量从 Anthropic 的 Claude Opus 迁移到开源模型 GLM 5.2,实际成本降低 68% 而非宣传的 95%。这揭示了“按 token 计价”与“按任务计价”之间的巨大鸿沟,也为大模型选型提供了真实的生产环境样本。
事件核心:发生了什么
Unblocked 是一家为 AI Agent 提供企业知识上下文的公司,其产品涉及代码审查、工程问答等 Agentic 循环。过去两年,其主力模型为 Anthropic 的 Claude Opus,占其 AI 支出的 80% 以上。今年夏天,该公司将大部分流量迁移到开源权重模型 GLM 5.2,由第三方推理服务商提供算力。
迁移基于一个诱人的“每 token”价差:GLM 5.2 的单价仅为 Opus 的约三分之一,若按某服务商仪表盘数据测算,理论节省可达 95%。然而,在真实生产环境中,Unblocked 用同一代码审查任务、同一提示词对比两个模型后,实际成本降低为 68%,并非 95%。原因在于 GLM 在任务中的行为模式不同:它更频繁地调用工具、更激进地探索、更容易出错导致额外回合,且单次调用消耗的 token 数更高(搜索流程中,单次调用平均 token 从约 18,500 升至约 24,700)。
在质量评估上,Unblocked 没有依赖内部主观判断或公开基准,而是搭建了双管道盲测:在真实代码审查中,同一 PR 分别由两个模型审查并发布评论,用户无法区分来源。通过记录用户对评论的“踩”或“赞”作为盲投,数千条生产级审查结果显示,Claude Opus 和 GLM 5.2 在用户反馈上并未拉开明显差距。
为什么重要
这一案例为“开源模型替代闭源前沿模型”提供了罕见的、基于生产环境的成本与质量数据。它说明,大模型迁移的决策不能只看价格表,而必须看“每任务成本”——这是一个由 token 单价与任务所需 token 数量共同决定的乘法关系。GLM 的“话多”与“探索性强”虽然在单价上占优,却部分抵消了价格优势。
更重要的是,Unblocked 的实践表明,在特定 Agent 场景下,开源权重模型已经能够接近闭源顶尖模型的用户满意度。这将对 AI 应用开发者的模型选型、企业 AI 采购的议价空间,以及开源社区与闭源厂商的竞争格局产生实质影响,而非停留在基准分数层面的空谈。
对用户/开发者/创作者的影响
对于正在构建 Agent 应用或使用大模型 API 的开发者,最直接的启示是:评估模型迁移时,应运行端到端的相同任务并对比账单,而不是对比 API 价格页。模型的“行为习惯”——如工具调用频率、错误率、回复冗长度——会显著影响实际成本与延迟,这些指标通常不会出现在基准测试中。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于企业 AI 采购决策者,此案例意味着开源模型在成本敏感型 Agent 工作流中已具备可行性,但需要投入工程资源做盲测评估与多提供商容错架构。对于普通用户而言,这类幕后迁移通常不会立即体现在产品体验上,但可能以降价或功能扩展的形式间接出现。
值得关注的后续
目前公开信息显示,Unblocked 保留了多提供商服务池(含“断路”机制)以应对兼容性问题。后续可重点观察三个点:一是 GLM 5.2 在其他类型的 Agent 任务(如长文档理解、多步骤规划)中是否仍能保持同等用户满意度;二是开源权重模型在每任务成本上能否进一步逼近或反超闭源模型,从而引发更多类似迁移;三是“OpenAI 兼容层”在切换不同模型时暴露的隐性兼容问题,是否会让模型提供商进一步标准化工具调用与输出格式,降低迁移成本。


