DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

DeepSeek 发布 DeepSeek-V4.1-Flash,把上下文窗口拉到 100 万 token,并引入 FP4 KV 缓存和跨层注意力复用,目标是在超长文本场景下同时压低显存占用和推理成本。

一句话看懂:DeepSeek 发布 DeepSeek-V4.1-Flash,把上下文窗口拉到 100 万 token,并引入 FP4 KV 缓存和跨层注意力复用,目标是在超长文本场景下同时压低显存占用和推理成本。

事件核心:发生了什么

据 MarkTechPost 报道,DeepSeek 于 2026 年 9 月 10 日推出 DeepSeek-V4.1-Flash。这款模型的核心卖点有三个:一是支持 1M(100 万)token 级别的上下文输入,二是采用 FP4 精度的 KV 缓存,三是引入跨层注意力复用(cross-layer attention reuse)。目前公开信息显示,这是一次面向长上下文推理效率的版本更新,而非单纯堆参数。FP4 KV 缓存意味着历史键值对以更低比特存储,直接减小长对话、长文档场景下的显存压力;跨层注意力复用则试图让不同网络层共享部分注意力计算结果,减少重复算力开销。

为什么重要

长上下文一直是大模型落地中最贵的部分:上下文越长,KV 缓存占用越大,推理延迟和成本上升越明显。此前不少模型宣称支持百万级上下文,但实际可用性和单位成本常被开发者质疑。DeepSeek 这次把优化重点放在缓存精度和注意力计算复用的组合上,等于从推理侧而非训练侧找效率空间。如果效果成立,它会进一步压低长文本 API 的调用门槛,也会给闭源厂商在长上下文定价上带来压力。同时,FP4 这类低精度格式进入 KV 缓存,也说明量化正在从权重向推理中间态延伸,可能影响后续模型的服务架构设计。

对用户/开发者/创作者的影响

对开发者来说,最直接的收益是长文档处理、代码库级检索、多轮长对话等应用的 token 成本可能下降;如果 DeepSeek 开放 API,接入方式大概率沿用现有接口,迁移成本不高。对创作者和企业用户而言,百万级上下文更适合整本书、整套合同或完整素材库一次投喂,减少切片和向量检索的工程复杂度。但也要注意,FP4 缓存对输出质量的实际影响、跨层复用的兼容性,仍需实测验证,不能只看参数。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是看官方是否公布 1M 上下文下的实际吞吐、延迟和定价,尤其是与上一代及竞品的对比;二是看 FP4 KV 缓存和跨层复用是否开源或写入技术报告,方便开发者复现;三是看其他厂商是否跟进类似推理优化路线,以及长上下文 API 的价格是否被进一步拉低。目前公开信息显示,具体可用渠道和基准成绩尚未完整披露。

来源:MarkTechPost(RSS)

celebrityanime
celebrityanime
文章: 22636

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注