一句话看懂:智谱在2026年8月14日发布GLM-5.3,参数规模保持740亿不变,依靠后训练把整体性能提升了约50%,编程和智能体任务能力明显逼近Claude系闭源模型,并已开放给开发工具用户使用。
事件核心:发生了什么
智谱正式发布新一代开源大模型GLM-5.3。模型基础参数仍为740亿,与此前的GLM-5.2持平,外界传闻的万亿参数升级并未出现,这一代把重心完全放在了后训练上。官方数据显示,相比上一代,GLM-5.3在多项基准上的综合性能提升约50%,并刷新了当前开源模型的多项纪录。
具体来看,在考察终端环境复杂任务执行能力的Terminal-Bench 3.0上,分数从4.6提升到28.3;在面向长程软件工程的DeepSWE v1.1上,从46.2升至66.9;在覆盖真实职业场景的Agents’ Last Exam上,从23.8增至28.5。此外在覆盖44个职业的GDPval-AA v2评测中,GLM-5.3拿到1769分。编程能力被普遍视为这代模型的核心卖点,其整体表现已接近Claude Fable 5,并超过其他国内模型。
产品落地上,GLM-5.3已接入智谱官方编程工具ZCode、效率工具AutoClaw,并向GLM Coding Plan及订阅用户开放。TraeWork、TraeCode、CodeBuddy、Qoder、OpenCode等第三方编程平台也已提供早期接入。API即将上线,模型权重将在完成安全加固后两周内开源。
为什么重要
GLM-5.3是一次“后训练路线”的正面验证。在参数不增加的前提下,通过数据筛选、对齐和推理路径优化,模型在编程、Agent任务上的能力依然能实现跨档提升,说明当前大模型的性能增长并非只能靠堆参数。这对行业而言是一个信号:训练算力固然重要,但后训练阶段的质量优化正在成为拉开差距的关键环节。
另一个值得注意的点是效率。在智谱自研的Z.ai Code Bench评测中,GLM-5.3在High模式下准确率达到31.4%,超过Claude Opus 4.8在Max模式下29.5%的成绩,但每个任务平均只消耗约5万Token,而Opus 4.8需要约12万Token。这意味着模型能以更短的执行路径完成同样的任务,直接关系到下游的推理成本和响应速度。
对用户/开发者/创作者的影响
对开发者来说,GLM-5.3的编程能力和Agent任务能力已经具备较强的实用价值,尤其在真实终端操作、多文件修改和跨工具协作场景下,和闭源模型的体验差距正在缩小。模型权重即将开源,意味着团队可以私有化部署,把代码托管在自己的算力和数据环境中,降低对外部API的依赖。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对采用Coding Agent工作流的企业,Token消耗减少意味着同样的任务预算可以覆盖更多请求,长期看能显著压缩自动化编程的边际成本。对普通内容创作者而言,这代模型的直接关联较弱,其价值更多体现在AI辅助开发工具和自动化工作流的底层升级上。
值得关注的后续
接下来有几个具体观察点。第一,API上线后的


