杨植麟在GTC2026 摊牌:月之暗面把Adam、全注意力和残差连接全换了,而且全部开源

月之暗面CEO杨植麟在GTC2026上公开了Kimi K2.5背后的三大核心技术替换——用MuonClip替代Adam优化器、用Kimi Linear(KDA注意力)替代标准全注意力、以及全新的Attention Residue架构替代传统残差连接,并且全部开源。这意味着在大模型训练接近数据瓶颈时,一家中国公…

杨植麟在GTC2026 摊牌:月之暗面把Adam、全注意力和残差连接全换了,而且全部开源

一句话看懂:月之暗面CEO杨植麟在GTC2026上公开了Kimi K2.5背后的三大核心技术替换——用MuonClip替代Adam优化器、用Kimi Linear(KDA注意力)替代标准全注意力、以及全新的Attention Residue架构替代传统残差连接,并且全部开源。这意味着在大模型训练接近数据瓶颈时,一家中国公司选择从底层算法重写Transformer核心组件,而非单纯堆算力。

事件核心:发生了什么

在GTC2026的演讲中,杨植麟详细拆解了月之暗面过去一年的技术路径。面对高质量文本数据即将耗尽的问题,团队没有选择继续增加参数量,而是重新实现了Transformer时代沿用近十年的三个基础组件:优化器Adam(2014年提出)、注意力机制(2017年)和残差连接(2015年)。

具体方案包括:MuonClip优化器替代Adam,在参数更新时保持不同方向信息独立,实验显示同等数据量下训练效果接近数据翻倍;为防止超大模型注意力层数值爆炸,配套设计了QK-Clip机制,在15万亿tokens训练中未出现loss spike。针对长上下文,推出Kimi Linear(KDA线性注意力),将线性注意力层与全注意力层以3:1比例混合,据称是首个在短上下文、长输入和长输出任务中全面超越全注意力的架构。此外,月之暗面还宣布了下一代架构Attention Residue

为什么重要

此举在AI行业有双重冲击。第一,它打破了“开源模型只能通过增大参数和算力追赶闭源”的路径依赖——月之暗面选择修改Transformer最基础的数学模块。第二,全部开源意味着开发者可以直接使用这些替代方案进行训练,降低了高质量数据稀缺带来的成本压力。如果MuonClip的效率提升数据(数据量翻倍效果)在大规模训练中稳定复现,它将直接改变训练成本的计算公式,对依赖算力堆砌的商业模式构成挑战。

同时,线性注意力(Kimi Linear)在Agent场景下的实际表现值得关注:若长上下文任务链(如持续数天的复杂任务)能稳定保留有效信息,它可能成为Agent架构的标配,而非Transformer的补充方案。

对用户/开发者/创作者的影响

对开发者:可以直接在GitHub上获取MuonClip和Kimi Linear的开源代码,尝试在自己模型的预训练或微调中替换优化器和注意力层。对于资源有限的团队,这可能是用算法替代算力的捷径——需注意QK-Clip在千亿级参数模型上的稳定性设置。目前公开信息显示,这些技术已在Kimi K2.5上经过15万亿tokens验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业用户:如果Kimi K2.5的长上下文能力(依赖KDA注意力)在Agent任务中持续有效,采购决策时应关注其对比GPT-4等闭源模型在连续任务完成率上的实际表现,而非仅看基准分数。

对AI创作者:这些改变目前主要影响训练和推理效率,不直接面向终端内容生成体验。但长期看,更低的训练成本和更稳定的长上下文推理,可能带来更便宜的API价格和更强的Agent类应用(如自动研究、多步工作流)。

值得关注的后续

1.MuonClip在第三方模型上的复现结果:开源后,是否有其他团队(如Meta、Mistral)在其模型上验证效率提升?若失败,需警惕可能存在的工程约束(如MoE架构适配问题)。

2.Attention Residue架构的落地时间:月之暗面已宣布下一代架构,是否会在Kimi K3中应用?若规划明确,可能引发对残差连接本身是否需要被替代的讨论。

3.闭源模型的应对:OpenAI、Anthropic是否会跟进修改基础组件?若选择不跟进,将加速开源社区在底层方法论上的分化。

来源:AIbase

celebrityanime
celebrityanime
文章: 14786

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注