在看了下DV4.1 Flash论文里的结构图然后和大佬们讨论之后,我觉得这次真正值得关注的,不是参数也不是跑分,而是DeepSeek又开始改Transformer本身了。 这次至少有三个很大的变化。 第一,又走回了Encoder + Decoder。 V4.1 Flash 上20层Causal Encoder + 20层Decoder。 当然,这不是回到传统 BERT/T5 那套,而是一个新的非对称结构。 Encoder负责读取、理解…

据 @MaxForAI 对 DV4.1 Flash 论文结构图的分析,DeepSeek 这次的看点不在参数和跑分,而是重新改动了 Transformer 结构:回归非对称 Encoder + Decoder、升级 CSA2 跨层复用 Attention、并让 Engram 条件记忆回归。

一句话看懂:据 @MaxForAI 对 DV4.1 Flash 论文结构图的分析,DeepSeek 这次的看点不在参数和跑分,而是重新改动了 Transformer 结构:回归非对称 Encoder + Decoder、升级 CSA2 跨层复用 Attention、并让 Engram 条件记忆回归。

事件核心:发生了什么

根据 @MaxForAI 的拆解,DV4.1 Flash 在架构层面至少有三处明显变化。第一是重新采用 Encoder + Decoder 结构,配置为 20 层 Causal Encoder 加 20 层 Decoder,但并非回到传统 BERT/T5 路线,而是非对称设计:Encoder 负责读取、理解并压缩输入,输入侧仅激活 8B 参数;Decoder 负责推理与生成,输出侧激活 16B。第二是将 CSA 升级为 CSA2,提供 Full、Reindex、Reuse 三种模式,让 KV 和 Top-K Index 可以跨层复用,注意力层按 Full → Reuse → Reuse → Reindex → Reuse 的节奏运行。第三是 V4 中缺失的 Engram 回归,它本质上是一套条件记忆,把固定搭配、实体、局部模式和静态知识直接从 Memory 中查取,而不必每层重算。

为什么重要

过去几年大模型的主流做法,是把同一种 Transformer 不断放大,用算力换能力。而 DV4.1 Flash 的思路转向了另一方向:哪些计算真正必要。读 100 万 Token 和生成下一个 Token 本来就不是同类任务,因此输入输出不必用同一套结构;Hidden State 每层都在变,但“该关注哪些 Token”未必需要逐层重新判断,于是能复用就复用;静态知识可以直接查记忆,不必让几十层网络反复计算。目前公开信息显示,这套设计把 MoE 的稀疏激活、Sparse Attention、CSA2 跨层复用和 Engram 记忆统一在同一条主线上,指向的是降低无效计算,而不是单纯堆参数。对行业而言,这意味着竞争焦点可能从规模转向结构效率。

对用户/开发者/创作者的影响

对开发者来说,如果这种非对称结构和跨层复用能够稳定落地,长上下文场景的推理成本有望下降,API 调用长文档、代码库或知识库的性价比可能改善。对普通用户,最直接的感受可能是长文本处理和生成速度更快、单位成本更低。对做 AI 应用和内容创作的团队,Engram 这类条件记忆若能开放接口,或为领域知识注入提供更轻量的路径。不过需要强调,目前这些判断来自对论文结构图的解读,实际吞吐、延迟和价格仍要看官方基准和线上表现。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 DV4.1 Flash 是否正式发布并开放 API,实际激活参数与定价是否与结构设计匹配;二是 CSA2 的跨层复用会不会被其他开源或闭源模型跟进,成为新的架构惯例;三是 Engram 作为条件记忆能否对外开放,影响开发者在长上下文和知识密集型任务上的方案选择。

来源:@MaxForAI

celebrityanime
celebrityanime
文章: 22677

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注