在看了下DV4.1 Flash论文里的结构图然后和大佬们讨论之后,我觉得这次真正值得关注的,不是参数也不是跑分,而是DeepSeek又开始改Transformer本身了。 这次至少有三个很大的变化。 第一,又走回了Encoder + Decoder。 V4.1 Flash 上20层Causal Encoder + 20层Decoder。 当然,这不是回到传统 BERT/T5 那套,而是一个新的非对称结构。 Encoder负责读取、理解…

据 @MaxForAI 对 DV4.1 Flash 论文结构图的分析,DeepSeek 这次的看点不在参数和跑分,而是重新改动了 Transformer 结构:回归非对称 Encoder + Decoder、升级 CSA2 跨层复用 Attention、并让 Engram 条件记忆回归。








