一句话看懂:智谱 AI 发布了开源权重模型 GLM-5.3,在复杂编程、长周期任务和网络渗透测试等场景能力大幅提升,官方称其为目前最强的开源编程模型。
事件核心:发生了什么
智谱 AI 于近期在 Hugging Face 平台开放了 GLM-5.3 的模型权重。官方技术说明指出,GLM-5.3 与 GLM-5.2 共享同一基座模型,所有性能提升均来自后训练阶段(post-training)的优化。根据智谱公开的评测数据,GLM-5.3 在自研 Z.ai Code Bench 上相较于 GLM-5.2 提升了 50%,并在 Terminal Bench 3.0、Agents’ Last Exam 等公开基准上达到开源模型最优水平。在具体分数上,GLM-5.3 在 Terminal Bench 3.0 上取得 28.3 分,而 GLM-5.2 仅有 4.6 分;在 ExploitBench 上,GLM-5.3 得分 54.4,是 GLM-5.2(24.4)的两倍以上。
另一个值得注意的维度是网络安全能力。智谱表示,随着后训练规模扩大,模型的“网络安全能力”以超出预期的速度增长。在 CyberGym 漏洞发现基准上,GLM-5.3 达到当前最优水平,且在漏洞利用链下游环节的提升幅度最大。
为什么重要
这一发布的意义主要体现在两个层面。第一,开源模型与闭源模型之间的竞争格局正在被重塑。GLM-5.3 在多个编程与代理任务基准上,不仅大幅超越前代,也开始与 Kimi K3、DeepSeek-V4 Pro、GPT-5.6 Sol 等闭源或半开源模型正面竞争。尽管部分基准(如 Terminal Bench 3.0)上 GLM-5.3 仍落后于 GPT-5.6 Sol 和 Fable 5,但差距已明显缩小,且其在部分任务上(如 ExploitBench 的 2 小时/6 小时评分)已经超越多数竞品。
第二,GLM-5.3 证明了“后训练”路径的潜力。在不更换基座模型的前提下,仅通过强化学习、推理预算控制等手段,就能将复杂任务表现提升 50% 以上,这对行业的技术路线选择具有参考价值——意味着算力投入的重点可能从预训练逐步向后训练和推理优化迁移。
对用户/开发者/创作者的影响
对于开发者而言,GLM-5.3 的权重完全开放,意味着可以本地部署或通过 SGLang、vLLM、Transformers、Unsloth 等主流推理框架进行私有化调用,无需依赖厂商 API,也更容易控制数据隐私和推理成本。不过需要注意,GLM-5.3 的默认推理预算为 max 档,这会显著增加推理耗时和算力消耗;在对话场景下需手动设置 clear_thinking=true 以减少思考过程输出。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于依赖 AI 编程助手或自动化代理(agent)的团队,GLM-5.3 在长周期任务(如 SWE-Marathon、DeepSWE、AutomationBench)上的显著提升,意味着可以处理更复杂的代码仓库级任务,但在实际使用时仍建议设置合理的超时和上下文管理策略。此外,其展示出的网络漏洞发现与利用能力,也提醒企业安全团队关注开源模型被用于攻击场景的可能性,在部署和使用时需要配套安全审查机制。
值得关注的后续
目前公开信息显示,GLM-5.3 的 API 版本已经可用,但具体的调用价格、速率限制以及面向国内用户的接入方式尚未披露,后续值得关注其商业化定价策略是否会对标同档位闭源模型。其次,GLM-5.3 的“后训练驱动”路线是否能延续到下一代基座模型,以及智谱是否会像 GLM-4.5 系列那样在更大参数量版本中进一步放大这一优势,也是观察重点。最后,考虑到网络攻击能力的溢出表现,社区和监管方对开源模型安全边界的讨论可能在近期升温,这会直接影响类似权重模型的发布节奏和可用功能范围。


