DeepSeek 开源 V4.1-Flash:CED 架构降低编码 Agent 的 prefill 开销

DeepSeek 本周在 HuggingFace 开源了 552B 参数的 V4.1-Flash,用 Causal Encoder-Decoder 架构把编码 Agent 最头疼的 prefill 开销压到每 token 仅激活 8B 参数,并已在 Baseten Model API 上线。它值得关注,因为这…

一句话看懂:DeepSeek 本周在 HuggingFace 开源了 552B 参数的 V4.1-Flash,用 Causal Encoder-Decoder 架构把编码 Agent 最头疼的 prefill 开销压到每 token 仅激活 8B 参数,并已在 Baseten Model API 上线。它值得关注,因为这是开源模型第一次在架构层面专门为 Agent 循环做算力不对称设计。

事件核心:发生了什么

DeepSeek-V4.1-Flash 是一个 552B 总参数的多模态 MoE 模型,支持 100 万 token 上下文,输入可含文本与图像、输出为文本。它最特别的地方是采用 CED(Causal Encoder-Decoder)架构:40 层被拆成 20 层编码器和 20 层解码器,解码器的 KV cache 直接从编码器输出投影而来。结果是 prefill 阶段只跑编码器、每 token 激活 8B 参数,decode 阶段才跑全模型、激活 16B。对照上一代 V4-Flash,prefill 和 decode 都是 13B,V4.1-Flash 等于用更重的 decode 换来了更轻的 prefill。

性能上,它以约三分之一的总参数量在编码和 Agent 基准上超过 V4-Pro,长程 Agent 任务提升达到两位数,但 Automation-Bench 得分 54.8,意味着复杂工作流仍有约一半会失败。图像理解是它首个非实验性的原生能力,图表解读和图像逻辑推理有进步,ZeroBench 仍未过 50 分。

为什么重要

编码 Agent 的运行特点是循环内反复回传几乎相同的上下文,prefill token 远多于 decode token。CED 把算力向 decode 倾斜,正好切中这个成本结构。同时,解码器 KV cache 由编码器投影而非逐层独立计算,配合压缩稀疏注意力(跨层共享 KV)和 FP4 KV 缓存,官方称全局 KV cache 内存仅为 V4-Flash 的四分之一。目前公开信息显示,这是同规模模型中唯一采用 CED 架构的。在 Z.ai、阿里接连推出低价开源模型之后,模型实验室的竞争已经从“堆参数”转向“为单位算力榨出更多智能”,这对靠 API 调用量赚钱的推理服务商是直接压力。

对用户/开发者/创作者的影响

如果你在跑编码 Agent 或长上下文应用,更小的 KV cache 意味着同样显存能装下更多上下文、缓存命中率更高,首 token 延迟和单卡吞吐都会改善,直接反映在 API 账单上。Baseten 已把它做成 Model API,Loops 支持也即将上线,试错成本不高。视觉能力适合接截图、仪表盘和 UI 稿做初步理解,但涉及重要决策时仍需要人工复核。需要注意的是,DeepSeek 平台已下线 V4-Flash 并把流量导向 V4.1-Flash,V4-Pro 流量也将从 9 月 14 日起改道,仍在调用 V4 系列的开发者应尽快升级。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 CED 是否被其他实验室跟进,若成为长上下文 Agent 的通用做法,会改变推理优化的方向;二是 Baseten 等第三方平台的定价是否随 KV cache 节省同步下调;三是它能否补齐 Agent 工作流的可靠性短板,把 Automation-Bench 这类成绩推过及格线。

来源:Baseten 工程博客(网页)

celebrityanime
celebrityanime
文章: 23132

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注