一句话看懂:阿里通义千问团队发布开源多模态 MoE 模型 Qwen3.8-Flash-Next,作为 Qwen4 架构的提前预览版,用 60 亿激活参数在多项任务上超越 Claude Opus 4.6 Max,训练成本仅为上一代的九分之一。
事件核心:发生了什么
8 月 27 日,阿里巴巴通义千问团队正式开源了 Qwen3.8-Flash-Next。这是一款采用高度稀疏混合专家(MoE)设计的模型,总参数规模为 1250 亿,另有 510 亿参数的 N-gram 嵌入表以及 40 亿参数的多 token 预测模块,但每个 token 仅激活 60 亿参数。模型为 48 层网络结构,MoE 层集成 512 个专家,采用 top-10 路由分配。
技术层面,该模型融合了多项更新:混合注意力机制结合了 GDN 与 QSA,以平衡长文本处理效率与信息检索精度;通过 YaRN 技术将原有 256K 上下文窗口扩展至 1M;引入 510 亿参数的 N-gram 嵌入,在不增加计算成本的前提下扩展容量,并支持通过异步预取将其驻留在系统慢速 DRAM 中;同时采用门控残差连接(GR)和微块粒度的稀疏注意力上下文选择设计。
生态方面,SGLang 在模型发布当天提供了 Day-0 级别的直接支持,开发者可通过开源渠道获取模型权重,并在本地或集群环境中完成部署。
为什么重要
Qwen3.8-Flash-Next 的核心意义在于验证了“极度稀疏 + 大容量嵌入”路线的可行性。在仅激活 60 亿参数的情况下,该模型在代码编写、办公等核心任务上的表现超越了 Claude Opus 4.6 Max 等顶尖闭源模型,同时训练成本降至 Qwen3.7-Plus 的九分之一。这一结果直接挑战了“更大模型必须更高成本”的行业共识,也为开源社区提供了一条兼顾性能与算力效率的技术路径。
作为 Qwen4 架构的前置预览,该模型的发布相当于提前披露了下一代架构的关键设计方向。对闭源厂商而言,这意味着开源模型的性能追赶速度可能超出预期;对企业用户而言,则意味着未来在同等算力预算下,可以获得显著更强的模型能力。
对用户/开发者/创作者的影响
对开发者而言,60 亿激活参数意味着推理阶段的内存占用和延迟显著低于同等性能的传统模型,本地部署的门槛进一步降低。配合 SGLang 的 Day-0 支持,开发者可以快速搭建基于该模型的应用服务,无需等待第三方适配。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业用户而言,训练成本降至九分之一这一数据具有直接的经济意义。如果该架构在 Qwen4 正式版本中得到延续,企业在微调和私有化部署上的算力预算压力将明显缓解,更多中型团队有机会拥有接近顶尖闭源模型的内部能力。
对创作者而言,1M 上下文窗口意味着可以直接处理超长文档、完整代码库或长篇剧本,而无需进行繁琐的分块拼接。多模态能力与稀疏架构的结合,也降低了在图像理解、视频分析等场景下运行高成本模型的顾虑。
值得关注的后续
第一,Qwen4 正式版的发布时间与架构是否与本次预览保持一致。Flash-Next 作为预览版本,其性能表现与最终版本之间可能存在差异,值得持续观察。
第二,N-gram 嵌入结合 DRAM 异步预取的方案在真实生产环境中的表现。该设计在学术测试中效果突出,但大规模并发场景下的稳定性仍需验证。
第三,竞品的跟进速度。Meta、Mistral 等开源主力是否会调整各自 MoE 架构的稀疏度设计,以及闭源厂商是否会因开源模型性能逼近而调整定价策略,都将是后续的重要观察指标。目前公开信息显示,该模型权重已通过开源渠道提供,具体许可证条款和商用限制有待进一步确认。
来源:AIbase


