通义千问发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览

通义千问发布 Qwen3.8-Flash,一个 125B 参数但仅激活 6B 的多模态 MoE 模型,首次公开预览 Qwen4 架构,并以极低 API 价格主打性价比。

一句话看懂:通义千问发布 Qwen3.8-Flash,一个 125B 参数但仅激活 6B 的多模态 MoE 模型,首次公开预览 Qwen4 架构,并以极低 API 价格主打性价比。

事件核心:发生了什么

8 月 26 日,通义千问团队通过官方 X 账号宣布推出 Qwen3.8-Flash,这是一个基于混合专家(MoE)架构的多模态大模型,也是 Qwen4 架构的早期预览版本。该模型拥有 125B 总参数和 51B N-gram 嵌入参数,但每个 token 仅激活 6B 参数,显著降低了推理算力需求。

在性能数据上,Qwen3.8-Flash 在 DeepSWE 1.1 上得分 58.7,SWE-bench Pro 得分 62.5,CoWorkBench 得分 73.9,AndroidWorld 得分 84.5,MathVision(带 CI)得分 95.7。模型原生支持 262K 上下文,可通过 YaRN 扩展到 1M。官方同步开源了权重,包括一个面向社区的 Qwen3.8-Flash-Next 版本。

商业化方面,生产版本将通过 QwenCloud API 提供,定价为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元。据官方称,该模型训练成本仅为 Qwen3.7-Plus 的九分之一,但在编程和办公任务上表现更强。

为什么重要

这次发布的核心信号是架构代际切换。Qwen3.8-Flash 采用了 GDN + QSA 混合注意力、Gated Residual、N-gram Embedding 和 Muon 优化器,官方明确表示这是 Qwen4 架构的前哨。这意味着阿里在大模型技术路线上不再只依靠扩大参数规模,而是转向更激进的架构创新来压缩训练和推理成本。

从行业竞争看,每 token 激活 6B 参数的设计将推理成本拉到了新低位,配合 0.16 美元/百万输入 token 的 API 定价,直接对标当前市场上主流开源模型的商业化定价。开源权重加上极低推理成本,可能会推动一波中小开发者和企业将工作负载从闭源 API 迁移到自托管或混合部署。

此外,多模态 MoE 同时覆盖文本、图像和代码任务,表明通义千问也在往“一个模型处理多种输入”的整合方向走,这与此前各家模型厂商逐步拆分专用模型的策略形成对比。

对用户/开发者/创作者的影响

对开发者而言,6B 激活参数意味着可以在更小显存的 GPU 或消费级硬件上运行模型,自部署门槛明显降低。配合 262K 原生上下文,适合处理长文档、代码库问答和复杂 Agent 工作流。API 价格远低于同类闭源模型,对高频调用场景(如批量内容处理、客服机器人、代码生成)的成本压力会小很多。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和内容团队,多模态能力与低推理成本结合,意味着可以更便宜地做图像理解、视频摘要、图文混合内容生成等任务,而不必在多个专用 API 之间切换。不过需要注意的是,当前发布的是早期版本,生产版本尚未完全上线,实际 API 的稳定性和生态工具链还有待观察。

值得关注的后续

第一,Qwen3.8-Flash 生产版本何时正式上线 QwenCloud API,以及实际推理速度和并发表现是否匹配官方宣传。第二,Qwen3.8-Flash-Next 开源后,社区是否能复现论文中的训练效率,这将直接影响开发者对 Qwen4 架构的信心。第三,其他开源模型厂商(如 Meta、Mistral、DeepSeek)是否会跟进类似的超稀疏 MoE 路线,引发新一轮推理成本竞争。

来源:X:通义千问 / Qwen (@Alibaba_Qwen)

celebrityanime
celebrityanime
文章: 20462

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注