GLM-5.3(开放权重)以五分之一成本击败 Anthropic/OpenAI 模型

第三方评测显示,智谱开源的 GLM-5.3 在 28 项真实任务中首次实现五项全满分,任务成本仅 0.28 美元,约为 GPT-5.5 和 Claude 系列模型同赛道成本的五分之一。这是开源模型在综合能力和成本效率上首次同时压过头部闭源模型。

一句话看懂:第三方评测显示,智谱开源的 GLM-5.3 在 28 项真实任务中首次实现五项全满分,任务成本仅 0.28 美元,约为 GPT-5.5 和 Claude 系列模型同赛道成本的五分之一。这是开源模型在综合能力和成本效率上首次同时压过头部闭源模型。

事件核心:发生了什么

据 Hacker News 转发的独立评测机构 Ed-O-Meter 最新榜单(7 月 14 日更新),智谱开源的 GLM-5.3 在编码、数据分析、真实世界任务、安全、工具调用五个维度的 28 项真实任务测试中全部通过,成为该榜单首个五项全绿(通过率 85% 以上)的模型。其综合通过率 100%,略高于 GPT-5.5 的 96%(后者在真实世界任务上为 89%)。

成本方面,GLM-5.3 完成整套测试仅需 0.28 美元,单任务约 0.01 美元;作为对比,GPT-5.5 全套成本 1.43 美元,Anthropic 的 opus-5 为 1.67 美元。GLM-5.3 的主要短板是响应速度,中位首 token 延迟为 16.3 秒,慢于 GPT-5.5 的 13.2 秒。

同一榜单中,Anthropic 的 fable-5 和 opus-5 均因安全策略拒绝执行部分无害调试任务,综合通过率被拉低至 79%。评测方特别注明,fable-5 的自评分数存在偏差,需等待独立复评。

为什么重要

这次评测的意义在于“全能”和“经济性”第一次在开源模型上同时成立。此前开源模型要么在个别科目领先,要么在综合能力上落后闭源头部一截;GLM-5.3 以五分之一成本跑出更高综合通过率,意味着对于大量可容忍延迟的批量任务(数据处理、代码生成、后台自动化),闭源 API 的定价优势正在被显著侵蚀。

另一个值得注意的信号是 Anthropic 全系模型(fable-5 与 opus-5)在同类调试任务上集体拒答,评测方认为这指向 Anthropic 安全分类器在整条 series 5 产品线上的系统性误伤——这种“过度防御”正在成为闭源模型在工程场景中的实际短板。

同时,榜单显示低价小模型(如 GPT-5.6-luna,单任务 0.0023 美元,中位延迟 5.3 秒)适合大规模低风险后台任务,但在安全科目上仅 33% 通过率,提示“便宜”和“安全”在轻量级模型上仍是不可兼得的取舍。

对用户/开发者/创作者的影响

对开发者,GLM-5.3 的开放权重和低成本意味着可以私有化部署或高频调用而不担心 API 账单爆炸,尤其适合批量代码审查、非实时数据处理、Agent 工作流中的子任务编排。但需注意其 16.3 秒的首 token 延迟——交互式聊天场景仍建议搭配 GPT-5.5 或 haiku-4-5 这类快速模型做前置响应。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购和 AI 应用开发者,目前公开信息显示 GLM-5.3 在成本敏感型场景(如批量内容审核、日志分析、报表生成)具备明显替代优势;但评测仅基于 28 项单任务测试,生产环境需自行验证其系统稳定性、上下文长度和指令遵循能力。

对内容创作者和普通用户,GLM-5.3 的全科通过意味着用开源模型处理混合型任务(先写代码、再分析数据、最后生成文案)不再需要切换多家 API,单模型全流程的工作流在成本和工程复杂度上更友好。

值得关注的后续

1. GLM-5.3 的 API 定价和开源许可细节是否与评测成本一致,若正式商用后价格上调,其竞争力需要重新评估。

2. Anthropic 是否会针对 fable-5/opus-5 的拒答问题调整安全分类器,以及调整后是否影响其在安全科目的满分表现。

3. 独立评测机构是否会扩大任务集规模——当前 28 项测试被认为覆盖真实场景,但样本量有限,更全面的任务集将验证 GLM-5.3 的“全能”成色。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 19861

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注