Qwen 开源 Qwen3.8-Flash-Next,SGLang 提供 Day-0 支持

Qwen 团队开源了 Qwen3.8-Flash-Next,这是 Qwen4 架构的早期预览版,SGLang 推理框架在发布当天就完成适配。该模型用稀疏注意力加 N-gram 嵌入的组合,在长上下文推理和显存占用上做了针对性优化。

一句话看懂:Qwen 团队开源了 Qwen3.8-Flash-Next,这是 Qwen4 架构的早期预览版,SGLang 推理框架在发布当天就完成适配。该模型用稀疏注意力加 N-gram 嵌入的组合,在长上下文推理和显存占用上做了针对性优化。

事件核心:发生了什么

8 月 26 日,Qwen 团队正式开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,同时被定位为 Qwen4 架构的早期预览。SGLang 团队与 Qwen、NVIDIA、AMD 合作,在发布当天提供了 Day-0 支持。模型总参数为 125B,外加 51B 的 N-gram 嵌入参数,实际每 token 激活 6B 参数。模型共 48 层,其中 36 层为 GDN 线性注意力,12 层为 QSA 稀疏注意力,MoE 层使用 512 个专家、Top-10 路由。SGLang 还同步放出了一个 NVFP4 量化版本,在 B200 上、TP4 配置下,单 batch 解码速度可达每秒 540 token,配合 MTP 投机解码的接受长度为 3.3。

为什么重要

这次发布的关键不在参数规模,而在架构选择。Qwen3.8-Flash-Next 把 Gated DeltaNet 的历史压缩能力和 Qwen Sparse Attention 的块级稀疏检索结合起来,目的是降低超长上下文场景下的计算和显存访问成本。另一个值得注意的点是 N-gram Embedding:它把一部分“局部模式记忆”放到主机内存中,通过异步预取来规避 GPU 显存占用,这在目前大模型推理普遍受显存瓶颈限制的背景下,是一个比较务实的优化方向。模型还引入了 Gated Residual 结构,把残差流扩展为 4 个分支并用动态门控控制读写,这延续了 Hyper-Connection 的思路。整体来看,Qwen 正在为 Qwen4 的正式版本探索一条不同于单纯堆参数的技术路线。

对用户/开发者/创作者的影响

对于开发者来说,SGLang 在发布当天就提供了完整的启动命令和不同负载的配置指南,这意味着可以直接用现成框架跑这个模型,不需要等第三方适配。NVFP4 量化版本的推出也降低了部署门槛——同等硬件条件下显存占用更小,单卡或小规模集群运行长上下文任务的可行性更高。对于依赖长文档处理、代码库分析或多轮复杂对话的 AI 应用开发者来说,QSA 稀疏注意力和 N-gram 嵌入的组合,可能在推理成本和响应速度上带来实际改善。不过目前公开信息显示,这批优化主要针对推理侧,训练侧的收益尚不清楚。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,Qwen4 正式版何时发布、是否会全面采用这套 GDN+QSA+Gated Residual 架构,值得观察。第二,NVFP4 量化版本的实际效果——包括精度损失和在不同硬件上的兼容性——需要更多第三方评测来验证。第三,其他推理框架(如 vLLM)是否会快速跟进对 QSA 和 N-gram 嵌入的支持,将直接影响该模型的生态普及速度。

来源:LMSYS:Blog(Chatbot Arena 团队)

celebrityanime
celebrityanime
文章: 20452

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注