阿里巴巴发布 Qwen3.8-Flash-Next,瞄准“极致成本效益

阿里 Qwen 团队发布 Qwen3.8-Flash-Next,用仅 60 亿激活参数的多模态 MoE 架构对标千亿级模型,训练成本只有前代的约九分之一,并将于近期以极低价格开放 API,进一步压缩大模型商业化的价格空间。

一句话看懂:阿里 Qwen 团队发布 Qwen3.8-Flash-Next,用仅 60 亿激活参数的多模态 MoE 架构对标千亿级模型,训练成本只有前代的约九分之一,并将于近期以极低价格开放 API,进一步压缩大模型商业化的价格空间。

事件核心:发生了什么

阿里巴巴 Qwen 团队于 8 月 26 日推出 Qwen3.8-Flash-Next,这是一款多模态混合专家(MoE)模型,总参数 1250 亿,但每个 token 仅激活 60 亿参数。该模型被视为 Qwen4 的架构预览,亮点是引入了 510 亿参数的 N-gram 嵌入层——将常见词组作为独立条目存储在类似“短语词典”的结构中,运行时放在系统 RAM 而非 GPU 显存,以“相对较低的额外成本”提升模型对短语级信息的利用。

该模型原生支持 26 万 token 上下文窗口,可通过 YaRN 扩展到百万 token。技术报告已在 GitHub 开源,权重同步上线 Hugging Face 与 ModelScope。生产版本将以 Qwen3.8-Flash 名称通过 QwenCloud 提供,定价为每百万输入 token 0.16 美元、每百万输出 token 0.47 美元,API 即将上线。

为什么重要

Qwen3.8-Flash-Next 的核心意义在于效率:据 Qwen 团队数据,它以约九分之一的训练成本实现了对前代 Qwen3.7-Plus(3970 亿参数、170 亿激活)的全面超越,尤其在编码和办公任务上提升显著。在官方基准中,Flash-Next 在 DeepSWE(58.7 分)、CoWorkBench(73.9 分)和 JobBench(55.7 分)等多数任务上领先于 DeepSeek-V4-Flash 和 Anthropic 的 Claude Opus 4.6,后者仅在 Humanity’s Last Exam 这一超难多学科测试上占优。

更值得关注的是定价策略。Flash-Next 性能略低于阿里当前的旗舰 Qwen3.8-Max,但价格仅为后者的约十二分之一。这种激进的性价比路线延续了阿里近期对开源社区的积极姿态,同时也对 OpenAI 和 Anthropic 的闭源商业模型形成持续的降价压力——OpenAI 已对新款 GPT-5.6 系列采取大幅折扣回应。大模型正从“拼参数”转向“拼单位成本的智能产出”。

对用户/开发者/创作者的影响

对开发者而言,Qwen3.8-Flash-Next 提供了一条低成本接入高性能模型的路径:每百万 token 输入仅 0.16 美元的定价明显低于同类推理模型,适合编码辅助、自动化办公流程、智能体(Agent)开发等对 token 消耗量大的场景。模型原生支持长上下文,且在 SWE-bench Pro 和 DeepSWE 等真实软件工程项目上表现突出,意味着中小团队可以以更低预算构建具备自主修 Bug 能力的编码工具。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和知识工作者,该模型在 CoWorkBench 和 JobBench 等办公协作基准上的优势,可能转化为更实用的文档处理、任务编排和数据分析体验。但需注意,基准分数与实际体验存在差异,且 N-gram 嵌入层在系统 RAM 中运行的具体性能表现仍有待实测验证。

值得关注的后续

首先,Qwen3.8-Flash-Next 作为 Qwen4 架构预览,其 N-gram 嵌入层的真实收益和局限性需要等待更多第三方评测检验。其次,生产版本 API 上线后的实际服务稳定性与限流策略值得观察,低价能否持续而不影响服务质量也是一个关键变量。最后,DeepSeek、Anthropic 等竞争对手是否会在近期跟进类似的 MoE 架构调整或价格策略,将直接影响企业采购和开发者选型的方向。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 20477

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注