DeepSeek V4.1 Flash 正式发布:552B MoE 新架构,全面超越 V4 Pro

DeepSeek 发布 552B 参数 MoE 新模型 V4.1 Flash,官方称其在性能、成本、速度上全面超过 V4 Pro,并把输入激活压到 8B、KV Cache 大幅缩减,试图用架构效率而非单纯堆参数来抢 Agent 场景。

一句话看懂:DeepSeek 发布 552B 参数 MoE 新模型 V4.1 Flash,官方称其在性能、成本、速度上全面超过 V4 Pro,并把输入激活压到 8B、KV Cache 大幅缩减,试图用架构效率而非单纯堆参数来抢 Agent 场景。

事件核心:发生了什么

2026 年 9 月 10 日,DeepSeek 正式发布 V4.1 Flash。它是一个 552B 参数的 MoE 模型,采用新的 Causal-Encoder-Decoder 结构,输入、输出激活不对称:输入激活仅 8B,输出激活 16B,原生支持多模态视觉理解。官方称新模型通过新预训练方法和更大规模强化学习训练,在多项基准测试中超过了包括 V4 Pro 在内的旗舰模型。

成本侧的关键变化是 KV Cache 压缩:相比上一代,HBM 需求降到 1/4,SSD 降到 1/8,相对原始模型 KV Cache 仅剩 1/437。API 已同步上线,模型名改为 deepseek-flash;旧版 V4 Flash 与 V4 Flash Vision Exp 停用,旧名称暂时路由到 V4.1 Flash。官方计划在 9 月 14 日 12:00(北京时间)后把 deepseek-v4-pro 的请求重定向到 V4.1 Flash,并按新价格计费。V4.1 Flash 已采用峰谷定价,9 月 10 日 12:00 生效,模型权重和技术报告已上 Hugging Face。

为什么重要

这释放的信号是:大模型竞争正从“参数规模”转向“激活效率与推理成本”。552B 的体量只激活 8B 输入,意味着同样的算力能承载更高吞吐,直接冲击 Agent 类应用的调用成本结构——在 Agent 场景里缓存命中费用往往占大头,KV Cache 被压缩几个数量级,会明显改变高频调用任务的经济性。同时,官方用 V4.1 Flash 直接替代 V4 Pro,说明内部判断“小激活 + 强训练”路线已经能覆盖上一代旗舰的能力,这会迫使同行重新审视 MoE 设计与定价策略。

对用户/开发者/创作者的影响

开发者最直接的变化是调用名和账单:改名为 deepseek-flash 即可接入原生多模态,旧模型名短期兼容但将逐步失效;9 月 14 日后调用 deepseek-v4-pro 会自动落到 V4.1 Flash 并按 Flash 价格计费,成本预期下降。对做 Agent、长上下文、批处理任务的团队,KV Cache 和 HBM 占用的下降可能意味着更低的自部署门槛——权重已在 Hugging Face 开源。腾讯 WorkBuddy、CodeBuddy 和 OpenCode 已作为官方合作方完成集成。创作者方面,原生多模态视觉理解为图像理解类工作流提供了新选项,但图像生成能力目前公开信息未提及,需以官方技术报告为准。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 V4.1 Pro 何时发布,以及它与 Flash 的定位差异;二是 9 月 14 日路由切换后,实际延迟、吞吐和缓存计费是否如官方所述;三是权重开源后社区微调与第三方部署的落地速度,以及竞品是否跟进类似的不对称激活架构。

来源:AIbase

celebrityanime
celebrityanime
文章: 22892

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注