一句话看懂:据 @MaxForAI 对 DV4.1 Flash 论文结构图的分析,DeepSeek 这次的看点不在参数和跑分,而是重新改动了 Transformer 结构:回归非对称 Encoder + Decoder、升级 CSA2 跨层复用 Attention、并让 Engram 条件记忆回归。
事件核心:发生了什么
根据 @MaxForAI 的拆解,DV4.1 Flash 在架构层面至少有三处明显变化。第一是重新采用 Encoder + Decoder 结构,配置为 20 层 Causal Encoder 加 20 层 Decoder,但并非回到传统 BERT/T5 路线,而是非对称设计:Encoder 负责读取、理解并压缩输入,输入侧仅激活 8B 参数;Decoder 负责推理与生成,输出侧激活 16B。第二是将 CSA 升级为 CSA2,提供 Full、Reindex、Reuse 三种模式,让 KV 和 Top-K Index 可以跨层复用,注意力层按 Full → Reuse → Reuse → Reindex → Reuse 的节奏运行。第三是 V4 中缺失的 Engram 回归,它本质上是一套条件记忆,把固定搭配、实体、局部模式和静态知识直接从 Memory 中查取,而不必每层重算。
为什么重要
过去几年大模型的主流做法,是把同一种 Transformer 不断放大,用算力换能力。而 DV4.1 Flash 的思路转向了另一方向:哪些计算真正必要。读 100 万 Token 和生成下一个 Token 本来就不是同类任务,因此输入输出不必用同一套结构;Hidden State 每层都在变,但“该关注哪些 Token”未必需要逐层重新判断,于是能复用就复用;静态知识可以直接查记忆,不必让几十层网络反复计算。目前公开信息显示,这套设计把 MoE 的稀疏激活、Sparse Attention、CSA2 跨层复用和 Engram 记忆统一在同一条主线上,指向的是降低无效计算,而不是单纯堆参数。对行业而言,这意味着竞争焦点可能从规模转向结构效率。
对用户/开发者/创作者的影响
对开发者来说,如果这种非对称结构和跨层复用能够稳定落地,长上下文场景的推理成本有望下降,API 调用长文档、代码库或知识库的性价比可能改善。对普通用户,最直接的感受可能是长文本处理和生成速度更快、单位成本更低。对做 AI 应用和内容创作的团队,Engram 这类条件记忆若能开放接口,或为领域知识注入提供更轻量的路径。不过需要强调,目前这些判断来自对论文结构图的解读,实际吞吐、延迟和价格仍要看官方基准和线上表现。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 DV4.1 Flash 是否正式发布并开放 API,实际激活参数与定价是否与结构设计匹配;二是 CSA2 的跨层复用会不会被其他开源或闭源模型跟进,成为新的架构惯例;三是 Engram 作为条件记忆能否对外开放,影响开发者在长上下文和知识密集型任务上的方案选择。
来源:@MaxForAI


