Kimi Linear:一种表现力强且高效的注意力架构

Kimi 团队发布了新型混合线性注意力架构 Kimi Linear,在短上下文、长上下文和强化学习场景下,全面超越了传统全注意力模型,同时将 KV 缓存占用降低最多 75%,1M 上下文解码吞吐量提升高达 6 倍。这可能是继 Mamba 后,对 Transformer 注意力机制最实用的一次效率革新。

一句话看懂:Kimi 团队发布了新型混合线性注意力架构 Kimi Linear,在短上下文、长上下文和强化学习场景下,全面超越了传统全注意力模型,同时将 KV 缓存占用降低最多 75%,1M 上下文解码吞吐量提升高达 6 倍。这可能是继 Mamba 后,对 Transformer 注意力机制最实用的一次效率革新。

事件核心:发生了什么

10 月 30 日,Kimi 团队(由 59 位作者署名)在 arXiv 上发表技术报告,正式推出 Kimi Linear 注意力架构。其核心创新是名为 Kimi Delta Attention(KDA) 的线性注意力模块。KDA 在 Gated DeltaNet 基础上引入了更细粒度的门控机制,能够更有效地利用有限状态 RNN 的内存。团队为此设计了一种专门的 对角线加低秩(DPLR) 块状计算算法,相比通用 DPLR 大幅降低了计算量。

为了验证效果,团队使用 KDA 与多头潜在注意力(MLA)的逐层混合,预训练了一个具有 3B 激活参数、48B 总参数的 Kimi Linear 模型。实验显示,在完全相同的训练流程下,Kimi Linear 在所有评估任务上均明显优于纯 MLA,且 KV 缓存占用降低最高达 75%,在处理 100 万 token 上下文时,解码吞吐量最高可提升 6 倍。

为什么重要

注意力机制的效率一直是制约大模型长上下文应用的主要瓶颈。传统全注意力模型虽然表达能力出色,但其 KV 缓存随序列长度线性增长,推理成本极高。此前,各类线性注意力(如 Mamba、RWKV)虽然提升了效率,但在短上下文等任务上性能往往不如全注意力。

Kimi Linear 的突破在于:首次在公平比较下,实现了一种线性注意力架构全面超越全注意力架构。这极大地提高了线性注意力路线的技术可行性。对于大模型行业而言,如果这一架构能够通过开源验证并扩展至更大规模,它可能成为下一代高效推理模型的基础,改变当前依赖长上下文缓存优化的竞争格局。

对用户/开发者/创作者的影响

目前,Kimi Linear 仍处于研究阶段,但其设计目标是作为全注意力架构的“直接替代品”,兼容现有训练和推理基础设施。Kimi 团队已开源了 KDA 的 kernel 和 vLLM 实现,并发布了预训练和指令微调模型权重。这意味着:

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

  • 开发者:可以立即在 vLLM 环境中尝试替换实验模型的注意力层。如果架构稳定,有望用更低的显存成本部署长上下文模型(例如支持百万 token 的 AI 助手),处理超长文档、代码库或对话历史。

  • 推理成本:KV 缓存减少 75% 直接对应 GPU 显存降低和更高并发。对于提供 API 服务的厂商,这可能转化为更低的长上下文推理价格。目前公开信息显示,模型权重已开放,但尚未公布 API 调用价格或商业部署日期。

  • 创作者:使用基于更长上下文的工具(如一次性分析书籍、生成超长剧本)时,体验有望提升,响应速度可能显著加快。

值得关注的后续

  1. 独立复现与扩展验证: 3B 参数的混合模型表现良好,但更大规模(如 70B 或 MoE 专家模型)以及纯线性层替代 MLA 的全线性架构是否仍然有效,需要社区验证。
  2. 产品落地与深度整合: Kimi 是否会将其作为自己 API 和聊天产品的底层引擎推出?如果落地,长上下文处理能力将成为核心差异化优势。
  3. 开源生态跟进: vLLM 的适配和社区 kernel 的成熟度,决定了该架构能否被快速集成到 Llama.cpp、HuggingFace Transformers 等主流框架中,从而影响更广泛的开发者生态。

来源:Hacker News 热门(buzzing.cc 中文翻译)

celebrityanime
celebrityanime
文章: 15596

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注