GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia

智谱AI(Z.ai)发布GLM-5.3-Flash,一个3200亿参数、上下文窗口达百万token的开源多模态大模型,推理成本仅为同系列大模型GLM-5.3的约七分之一,且全程运行在中国国产AI芯片上,未依赖Nvidia的CUDA生态。

一句话看懂:智谱AI(Z.ai)发布GLM-5.3-Flash,一个3200亿参数、上下文窗口达百万token的开源多模态大模型,推理成本仅为同系列大模型GLM-5.3的约七分之一,且全程运行在中国国产AI芯片上,未依赖Nvidia的CUDA生态。

事件核心:发生了什么

据The Decoder报道,智谱AI在2026年8月27日发布了GLM-5.3-Flash。该模型总参数3200亿,但仅激活180亿参数,采用MIT开源协议,权重已上传Hugging Face。在Artificial Analysis的智能指数评测中,GLM-5.3-Flash在最大推理强度下获得57分,仅比更大的GLM-5.3低3分,与GPT-5.6 Terra和Muse Spark 1.2持平。

价格是最大亮点:该模型每任务推理成本约0.09美元,而GLM-5.3为0.68美元,相差约7.5倍。API定价为每百万输入token 0.15美元、每百万输出token 0.50美元,约为GLM-5.3的十分之一。此外,智谱透露该模型在发布前曾以“ox-alpha”的匿名身份在OpenCode和OpenRouter上测试,并成为当周最热模型,期间所有流量均运行在中国国产AI芯片上。

为什么重要

GLM-5.3-Flash的意义不只是“便宜”,而是它同时展示了两个趋势。第一,中国大模型在价格上的竞争压力进一步加大:据SemiAnalysis报道,该模型每天处理约100万亿token,这种容量此前被认为只有头部实验室才能达到,而如此大批量的推理负载完全跑在国产芯片上,是对Nvidia“CUDA护城河”的一次实际检验。CUDA是Nvidia运行近20年的软件生态层,几乎所有AI框架都为它做过优化,切换芯片意味着重新优化算子、内存访问和瓶颈调优。

智谱自研了基于SGLang的推理服务软件,将处理流程拆分为独立扩展的阶段,据称吞吐量比第一版方案提升三倍,优化过程中还使用了GLM-5.3智能体辅助。这表明在推理侧,国产芯片配合自研软件栈已具备与Nvidia GPU相当的成本和效率水平,至少在部分场景下成立,而非仅仅是概念验证。

对用户/开发者/创作者的影响

对开发者而言,GLM-5.3-Flash以MIT协议开源,意味着可以自由商用修改,配合百万token上下文和低API价格(输入0.15美元/百万token),适合做长文档处理、大规模Agent任务或高并发应用。在GDPval-AA v2智能体基准上,它Elo约1770分,追平GLM-5.3和Grok 4.6,仅落后于Claude Opus 5。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

需要留意的是,该模型的token效率仍有不足,Artificial Analysis发现约90%的输出token消耗在推理链上,实际使用中可能响应体量更大,成本虽低但延迟不一定优于同类模型。对内容创作者,它的多模态能力支持图像输入,但评测中未单独披露图像生成或编辑的专项数据,目前公开信息显示其强项仍是文本推理和成本控制。

值得关注的后续

一是国产芯片推理的规模化能否延续,后续是否有其他厂商跟进在国产芯片上跑大流量推理;二是GLM-5.3-Flash的API在真实商业负载下的稳定性和实际吞吐表现;三是竞品是否会在价格上进一步压缩,特别是GPT-5.6 Terra和Claude Opus系列可能如何回应智谱的低价策略。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 20683

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注