一句话看懂:DeepSeek-V4.1-Flash 技术报告公开,核心是把 KV Cache 压缩到前代约四分之一,同时用 Causal Encoder-Decoder 架构把 Prefill 激活参数降到 8B、Decode 保持 16B。它解决的是长任务 Agent 场景下显存、SSD 和互联带宽被 KV Cache 拖死的问题。
事件核心:发生了什么
据技术报告《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,该模型参数规模 552B,原生支持多模态输入和最高 100 万 token 上下文,采用 Causal Encoder-Decoder(CED)架构:Decoder 的全局 KV Cache 由 Encoder 最终隐藏状态投影得到。整模型 40 层,Prefill 阶段只需激活其中 20 层,因此 Prefill 激活参数 8B、Decode 激活参数 16B。报告称同序列长度下,其运行时 KV Cache 存储约为 DeepSeek-V4-Flash 的 1/4,持久化 KV Cache 约为 1/8。
为什么重要
长周期 Agent 工作流会让上下文不断变长,工具调用又带来大量 Prefill 计算。此时瓶颈往往不是算力,而是 KV Cache 在 HBM、主机内存和 SSD 之间的存储与搬运,直接限制吞吐并抬高部署成本。DeepSeek 这次从架构层压缩 KV Cache:借鉴 GQA 的头数压缩、块级压缩、跨层压缩以及稀疏注意力的 indexer 优化,并采用 FP4 KV Cache。换句话说,竞争点正从“堆参数”转向“每 token 的缓存开销”。
对用户/开发者/创作者的影响
对做 Agent、代码助手和长文档处理的开发者,最直接的变化是同等硬件下可承载更长上下文与更高并发,前缀复用和持久化缓存的成本也会下降。API 侧若延续这一架构,长输入任务的单价和延迟有望改善。对企业和创作者而言,百万 token 上下文的多模态模型若稳定落地,长视频、代码库、多轮工具调用类应用的可行性会提高。目前公开信息显示,模型的具体开放方式、定价和上下文实际可用长度仍待官方说明。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 DeepSeek-V4.1-Flash 是否通过 API 或开源形式开放,定价与限流策略如何;二是压缩 4 倍 KV Cache 后,长上下文任务的质量衰减是否可控,FP4 精度在真实 Agent 负载下的表现;三是其他厂商是否跟进 CED、跨层 KV 压缩等路线,把长上下文推理成本继续压低。
来源:Hacker News


