一句话看懂:智谱今日发布并开源了GLM-5.3-Flash(320B-A18B),这是一款能力对标Claude Opus 4.8的前沿原生多模态模型,但定价仅为后者的1/40,且推理服务已跑通国产芯片集群。
事件核心:发生了什么
智谱于今日正式上线并开源GLM-5.3-Flash,这是GLM-5系列的首个原生多模态模型。该模型总参数量为320B,激活参数仅18B,在Artificial Analysis Intelligence Index(AA综合智能指数)中取得57分,与Anthropic的Claude Opus 4.8得分持平。在自研Z.ai Code Bench评估中,其编程表现也与Opus 4.8相当。
定价方面,GLM-5.3-Flash正式价格为GLM-5.3的1/10,限时折扣期间为1/20,相当于Opus 4.8的1/40。值得注意的是,该模型在正式发布前曾以匿名身份“Ox-Alpha”(中文社区称“牛来”)在OpenCode和OpenRouter上开放测试,迅速成为当周双平台调用量最高的模型,且这些请求流量全部由国产芯片集群提供算力支持。
为什么重要
这次发布的核心意义在于打破了“前沿智能=前沿价格”的行业惯性。GLM-5.3-Flash用更低的推理成本实现了对标国际顶级闭源模型的智能水平,其架构创新是关键:相比GLM-4.5,总参数相近(355B vs 320B),但激活参数从32B降至18B,层数从92减至45。它也是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,注意力计算量与KV缓存较GLM-5.3分别降低3.01倍和4.44倍。
另一个重要信号是国产芯片的规模化落地。智谱在SGLang基础上构建专用推理引擎,通过EPD(Encode-Prefill-Decode)分离式架构和激进的内存优化,在国产加速芯片集群上实现了端到端服务性能较初始基线提升3倍,硬件效率和单token成本达到与主流英伟达GPU相当的水平。这意味着国产算力已能支撑前沿大模型的大规模商用推理。
对用户/开发者/创作者的影响
对开发者而言,GLM-5.3-Flash已开源(Hugging Face提供BF16权重),并接入ZCode等编码平台,同时开放API调用,纳入GLM Coding Plan(每天限量发放10,000张体验卡)。1/40的价格意味着可以更自由地将前沿模型能力嵌入高频调用场景,而不再需要精打细算token成本。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者和专业工作者,该模型的原生多模态能力扩展了应用边界:前端开发、游戏和3D仿真等场景中,模型可自主“观察”渲染结果并迭代改进;在办公领域,它针对PPTX、PDF、DOCX、XLSX等文档任务新增了视觉理解与自我验证能力,还能覆盖金融研报、法律合同审查等专业流程,生成即交付。
对于关注算力自主可控的企业,GLM-5.3-Flash证明国产芯片已能在大规模流量下高效支撑前沿模型推理,为后续采购和部署提供了现实依据。
值得关注的后续
一是国产芯片推理的规模化验证:此次大规模流量测试是首次,后续能否在更长周期内保持稳定、成本是否如宣称般具备竞争力,需要持续观察。二是开源生态的跟进速度:作为开源模型,社区能否围绕其混合注意力架构快速形成微调、部署和工具链生态,将影响其实际渗透率。三是价格战对行业的影响:以1/40的价格对标Claude Opus 4.8,是否会引发其他头部厂商调整定价策略或加速推出低成本旗舰模型,值得关注。


