一句话看懂:2026 年 10 月 5 日 Hugging Face Papers 收录的论文提出 Hybrid Linear Attention(HLA),为 Gated DeltaNet 加入查询依赖的分块级注意力路由,声称在 Qwen3.5 系列上提升长上下文评测表现。它值得关注,是因为这触及线性注意力“压缩历史后难以精确取用远距离信息”的老问题。
事件核心:发生了什么
该论文提出一种叫 HLA 的混合线性注意力机制,思路是在线性注意力已有的分块压缩基础上,把每个已完成的分块表示成精确的仿射状态转移,再用自注意力池化得到的紧凑代表向量,计算与当前查询内容相关的路由门控。这些门控决定每个历史分块被保留多少:既能调节该分块带来的加性记忆,也能调节它对更早状态的变换。论文还引入“有效支撑正则化”,鼓励路由更集中,以支持稀疏推理。
作者在两种设定下评估:从预训练模型适配和从头训练。摘要称,在 0.8B 到 9B 的 Qwen3.5 模型上,HLA 相比原生 GDN 和固定分块混合都有提升,LongBench-V2 最高提升 5.57 个百分点,RULER 提升 3.97 个百分点;在 1.3B、100B tokens、4K 上下文的从头训练对照中,RULER 从 4K 到 32K 均有改善,增益从 0.83 个百分点增至 4.22 个百分点。需要说明的是,以上均来自论文摘要,未核验全文实验,也不代表已有商业产品上线。
为什么重要
长上下文现在是大模型竞争的关键方向,但线性注意力类方法一直在效率与精确检索之间取舍。把历史压进固定递归状态,推理成本低,却容易丢失稀疏、远距离的关键信息。HLA 的价值在于:不把历史访问策略写死,而是让每个查询动态决定读哪些分块。如果这一机制在更大规模、更多任务上成立,可能影响长上下文模型在训练与推理阶段的架构选择,也可能成为开源模型对标闭源长上下文能力的一条路线。
对用户/开发者/创作者的影响
目前公开信息显示,HLA 仍是论文层面的方法,没有可直接调用的 API 或已发布模型。对开发者而言,它的意义是提供了一种可参考的长上下文优化方向:用分块仿射状态和查询相关门控,在保留线性注意力推理效率的同时改善信息取用。对使用 AI 应用或做大模型推理部署的团队,短期不必改变现有选型,但可以关注后续是否出现基于 GDN 或类似架构的开源实现、训练脚本与推理内核。对内容创作者来说,长上下文能力若真正提升,可能改善长文档、多轮对话和复杂资料整理场景的稳定性,但仍需等待可验证的产品落地。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是论文是否公开完整实验设置、消融结果和代码,尤其是更长上下文与不同模型家族上的表现;二是 HLA 能否集成进现有 GDN 推理框架,带来接近线性注意力的实际吞吐,而不是只体现在评测分数上;三是 Qwen 之外的开源或闭源模型是否跟进类似查询依赖分块路由,以及长上下文评测榜单是否出现可复现的对比结果。


