一句话看懂:阿里开源了2.4万亿参数的Qwen3.8-2.4T-A95B(Qwen3.8-Max),NVIDIA随即展示了它在GB300 NVL72机架级系统上的推理表现:不微调即可实现每GPU每秒超4000 token的吞吐。这是目前开源界参数规模最大的模型之一,值得关注的不只是“大”,而是混合注意力+细粒度MoE架构把大模型服务成本真正压了下来。
事件核心:发生了什么
阿里发布了Qwen3.8-2.4T-A95B(又称Qwen3.8-Max)的开源权重。这个模型总参数为2.4万亿,但采用细粒度混合专家(MoE)架构,每个token只需激活95B参数。它混合了全注意力和线性注意力两种机制,支持最高100万token的上下文输入和128K的输出长度,定位是复杂推理和智能体(Agent)工作负载。
NVIDIA方面同步给出了在GB300 NVL72上的首批测试数据:在FP8精度下,不额外调优即达到每GPU每秒超4000 token的吞吐,单用户每秒超350 token。GB300 NVL72将72块Blackwell Ultra GPU整合为一个NVLink域,提供130 TB/s的全互联带宽,这是它能够服务2.4T参数模型的关键。目前该模型权重已可在Hugging Face和ModelScope下载,并可通过SGLang、vLLM、NVIDIA Dynamo或NVIDIA NIM容器部署。
为什么重要
这件事的意义不只是“又出了一个大模型”,而是它验证了一条开源技术路线:用2.4T总参数逼近闭源前沿模型,同时通过MoE架构把实际推理成本控制在接近小模型水平。细粒度MoE把专家切得更小更密,路由效率更高,服务成本跟着激活参数走,而不是总参数。
更值得关注的是混合注意力设计——全注意力层保留全局建模能力,线性注意力层用有界循环状态替代不断增长的KV缓存,让百万token上下文不再意味着算力和显存的线性膨胀。这直接影响智能体类应用的落地成本:多轮工具调用、长文档分析、代码仓库级理解,过去是“跑得动但贵得离谱”,现在有了一个可规模化的开源选项。对NVIDIA来说,这同时也是Blackwell Ultra平台在AI工厂场景下的一次算力展示。
对用户/开发者/创作者的影响
对开发者而言,最直接的利好是这个模型支持“可配置推理”:请求级别选择低/高/最高三档推理深度,简单文档处理用低档省算力,复杂多步推理用高档换质量。这意味着同一个部署能服务不同预算的调用方。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
NVIDIA为这个模型提供了Day-0微调支持,PyTorch原生的NeMo AutoModel可以直接读取Hugging Face checkpoint,无需格式转换,即可做全参数SFT或内存更省的LoRA微调。对做垂直领域应用、智能体产品的团队来说,可以基于开放权重定制自己的模型,再用NIM容器直接部署到生产环境。
对普通用户的影响不是“你能跑这个模型”,而是“你能以可接受的成本用到接近闭源前沿的推理能力”——前提是有厂商将这类模型以API形式托管。个人电脑跑不了2.4T参数的模型,这是明确的算力门槛。
值得关注的后续
目前公开信息显示,NVIDIA声称的吞吐数据是在GB300 NVL72这一特定硬件上获得的,实际部署效果取决于硬件配置和推理框架。接下来有四个观察点:第一,阿里云或其他API平台是否提供该模型的托管服务,以及定价相对闭源模型是否有竞争力;第二,NVFP4精度优化落地后,吞吐和成本还能改善多少;第三,其他开源大模型是否会跟进“全注意力+线性注意力”混合架构,毕竟这决定了长上下文推理的性价比上限;第四,GB300 NVL72的生产交付节奏,它是否真的能成为“AI工厂”的通用基础设施。


