GLM-5.3(开放权重)以五分之一成本击败 Anthropic/OpenAI 模型

智谱新发布的 GLM-5.3(开放权重模型)在多个第三方编程评测中表现接近美国头部模型,但成本仅为对方五分之一。然而,该结论在社区引发不小争议——部分开发者认为测试样本量过小、评分标准受 AI 辅助影响,并不能代表真实编码能力。

一句话看懂:智谱新发布的 GLM-5.3(开放权重模型)在多个第三方编程评测中表现接近美国头部模型,但成本仅为对方五分之一。然而,该结论在社区引发不小争议——部分开发者认为测试样本量过小、评分标准受 AI 辅助影响,并不能代表真实编码能力。

事件核心:发生了什么

根据 Hacker News 爆料,国内大模型公司智谱发布了 GLM-5.3 开放权重模型。在 Gertlabs 等多代理编程评测榜单上,GLM-5.3 综合排名约第六,接近 Anthropic 和 OpenAI 的旗舰模型。值得注意的是,其 API 调用成本仅为 Anthropic/OpenAI 同级模型的五分之一,性价比亮眼。

不过,围绕这一排名的争议同样不小。Hacker News 的讨论中,多位开发者对评测方式提出质疑:整个测试集仅有 28 个任务,样本量过小;评审指标中“Rubric Quality”项由 Fable 5 模型评分,而非人工核对;更有人指出,GLM-5.3 作为中国模型,在多次迭代、测试框架内表现优异,但在首次回答及“基础流体智力”方面,仍与美国前沿模型存在差距。部分开发者反馈称,Haiku 模型在该评测中能追平 Kimi K3,与真实使用体验严重不符。

为什么重要

这起事件的核心信号,并非“某款模型是否超越 GPT”,而是开源/开放权重模型在成本、速度维度上正在逼近甚至追平闭源头部产品的现实。GLM-5.3 以五分之一成本做到接近一线的成绩,意味着对于大量价格敏感、量大面广的开发者任务(如代码生成、agent 调度、批量信息抽取),闭源头部模型的“护城河”正在被成本优势侵蚀。

此外,社区对评测方式的集体质疑,也暴露了当前行业的一个结构性问题:基于预置任务集的 benchmark 已经越来越难以准确反映真实开发场景中的复杂需求。正如评论中所指出的,“能否通过预设的 SWE 测试”并不等于“能否创造全新的东西”,大模型的实际价值往往体现在后者。

对用户/开发者/创作者的影响

对开发者而言,关键在于按需选择模型而非只看榜单排名。如果你的场景是高频、海量调用或需要大批量并发请求,GLM-5.3 这类性价比模型可能大幅降低推理预算;但如果你需要的是极高的首次回答准确性、复杂指令遵循能力或强逻辑推理,现阶段头部闭源模型(如 Fable 5 或 Opus 5)在体验上仍然不可替代。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业在采购模型时的启示同样直接:不要盲目迷信单一评测榜。用自家真实业务场景做小样本测试,再决定是否从昂贵的旗舰模型降级到更小、更快、更便宜的替代品——这一建议在当前环境下依然是最务实的路径。同时,GLM-5.3 的开放权重特性,也为需要本地化部署或安全合规要求的企业提供了新的选择空间。

值得关注的后续

首先,关注 GLM-5.3 官方 API 的正式定价与实际推理速度是否符合预期——性价比才能真正落地。其次,观察其他中国大模型厂商(如 DeepSeek、通义等)是否会在价格和开放策略上跟进,进一步挤压闭源模型的价格空间。最后,留心开源社区对 GLM-5.3 在真实开发项目中的反馈,尤其是复杂指令执行、代码可维护性和长时间 agent 任务中的表现,是否能支撑评测榜上的高排位。

来源:hackernews

celebrityanime
celebrityanime
文章: 19845

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注