一句话看懂:阿里发布了 Qwen3.8-Flash-Next 176B 混合专家模型的预览权重,NVIDIA 随即在 GB300 NVL72 平台上完成适配验证,为超长上下文的智能体编程场景提供了高吞吐推理方案。
事件核心:发生了什么
阿里以预览形式放出了 Qwen3.8-Flash-Next 的模型权重,供开发者提前试验下一代 Qwen4 架构。该模型是一个多模态 MoE(混合专家)模型,总参数 176B,其中包含 51B 的 N-gram 嵌入参数,每个 token 仅激活 6B 参数。它原生支持 262,144 token 的上下文窗口,并可通过 YaRN 扩展到 100 万 token。
NVIDIA 提供了 Day 0 功能支持,覆盖 SGLang、vLLM 和 TensorRT LLM 三个推理栈,并在 GB300 NVL72 上完成了推理验证。GB300 NVL72 是机架级平台,整合 72 块 Blackwell Ultra GPU,NVLink 域内全互联带宽达到 130 TB/s。实测数据显示,该模型在 GB300 NVL72 上每 GPU 吞吐超过 16K tokens/秒,每个用户可获得超过 200 tokens/秒的生成速度。
为什么重要
Qwen3.8-Flash-Next 的核心看点在于混合架构设计:每四层中三层使用 Gated DeltaNet(GDN),将历史上下文持续压缩进固定大小的循环状态,从而消除长序列下 KV cache 的持续增长;剩下的一层使用 Qwen Sparse Attention(QSA),在完整上下文中做精确检索。这种设计直接针对长上下文推理的两大瓶颈——注意力计算和缓存内存。
与以往依赖 token 级索引的稀疏注意力不同,QSA 将序列聚合成微块并按块评估重要性,显著降低了注意力计算和索引开销。阿里公开的测试显示,在 100 万 token 的工作负载下,QSA 的注意力内核相比全注意力在 prefill 阶段最高加速 7.6 倍,decode 阶段加速 4.9 倍;在 90% 前缀缓存命中率的在线服务测试中,Qwen3.8-Flash-Next 的 prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。
这套组合方案的行业意义在于:它为智能体编程、文档处理等高频长上下文场景提供了不随序列长度线性膨胀的推理成本路径,同时 MoE 结构控制住了单 token 激活参数,使得大规模部署在经济性上更可接受。
对用户/开发者/创作者的影响
对开发者而言,NVIDIA 同时提供了 NeMo AutoModel 微调库和 NeMo RL 强化学习配方,支持直接从 Hugging Face 检查点开始做 SFT 或 LoRA 微调,无需模型转换。这意味着开发者可以在现有权重上快速定制领域模型,再通过 SGLang、vLLM 或 TokenSpeed 按需选择推理引擎。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对算力需求较弱或处于原型验证阶段的团队,Qwen3.8-Flash-Next 也支持在本地硬件上运行,包括 DGX Station、DGX Spark 集群以及四卡 RTX PRO 6000 Blackwell 工作站;同一模型可以从本地原型平滑扩展到 GB300 NVL72 做生产部署。
对应用层的创作者和产品团队来说,100 万 token 上下文配合稀疏注意力带来的成本改善,意味着更长的代码仓库分析、更完整的文档级理解和多轮工具调用工作流具备了实际落地的性价比基础。目前模型权重可通过 Hugging Face 和 ModelScope 下载,也可直接通过 QwenCloud 试用。
值得关注的后续
第一,Qwen4 正式版架构是否会完整延续 GDN 加 QSA 的混合路线,以及正式版相对预览版的性能差距有多少,值得跟踪。
第二,其他云厂商和推理服务商是否会在自有平台上跟进部署该模型,这将直接影响实际推理定价。
第三,GDN 循环状态与 QSA 块级检索的组合在 100 万 token 超长上下文下的实际准确率和长程依赖保持能力,仍需独立评测验证,现有数据主要来自阿里公开的基准测试。


