循环语言模型实现动态计算:KV缓存策略最多减少30%算力与内存

一篇 arXiv 新论文提出“best-available”KV 缓存策略,让循环语言模型在保持全深度性能的同时,最多减少 30% 的 FLOPs 和 KV 内存,并让 token 按难度在不同深度退出。

一句话看懂:一篇 arXiv 新论文提出“best-available”KV 缓存策略,让循环语言模型在保持全深度性能的同时,最多减少 30% 的 FLOPs 和 KV 内存,并让 token 按难度在不同深度退出。

事件核心:发生了什么

2026 年 10 月 8 日,arXiv cs.AI 收录了一篇新论文,主题是让循环语言模型(Looped LMs)真正实现动态计算。论文指出,当前开源循环模型 Ouro 虽然宣称具备动态计算能力,但每个循环深度都需要独立的 KV 缓存,导致所有循环计算仍必须执行;同时,其 early-exit 先验对所有 token 一视同仁,结果无论难易,所有 token 都按接近固定低深度处理。

作者提出一种可直接使用的“best-available”KV 缓存策略,在性能与深度之间开辟新空间。摘要显示,该方法最多可减少 30% 的 FLOPs 和 KV 内存,同时保留全深度性能。此外,训练时让模型感知这一缓存策略能进一步提升性能和效率;对 early-exit 先验目标的小修正,也让 token 能根据实际计算需求在不同深度退出。论文在 Ouro 模型和从零预训练的小型循环模型上验证了这些发现。需要说明的是,以上信息来自论文摘要,全文实验尚未经过同行评审。

为什么重要

循环语言模型的核心卖点之一,就是用更少参数实现更强表达,并承诺在简单 token 上节省算力和内存。但 Ouro 的实际情况说明,动态计算从“设计目标”到“推理可用”之间还隔着 KV 缓存这堵墙。如果每个循环深度都要保存独立缓存,那么动态深度带来的收益会被内存和算力开销抵消,部署成本难以下降。

这篇论文的意义在于,它没有重新设计模型架构,而是从缓存策略切入,尝试用工程手段解锁循环模型的动态计算能力。对行业而言,这直接关系到推理成本和显存占用——这两项是大模型商业化落地的硬约束。如果后续工作能验证并推广这一策略,循环模型在端侧、长上下文和低成本 API 场景中的竞争力会明显增强。

对用户/开发者/创作者的影响

对开发者和企业采购方来说,最直接的影响是推理成本可能下降。摘要中的 30% FLOPs 与 KV 内存减少,如果能在真实业务负载上复现,意味着同样硬件可以支撑更高并发或更长上下文,API 价格也可能随之松动。对使用大模型做内容生成、代码补全或客服系统的创作者和团队,模型在简单 token 上“少算几层”不会明显影响输出质量,却可能带来更快的响应速度。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

不过,目前公开信息仅来自论文摘要,尚未看到生产级 API 或开源推理框架的集成方案。开发者暂时不宜将“30% 节省”视为可直接调用的产品能力,更合理的做法是关注 Ouro 等循环模型后续是否发布配套推理代码,以及该缓存策略能否在 vLLM、TensorRT-LLM 等主流框架中复用。

值得关注的后续

第一,Ouro 官方是否会跟进这一 KV 缓存策略,并给出可复现的推理实现。第二,从零预训练的小型循环模型实验结果能否扩展到更大规模模型,30% 的节省比例在更大深度下是否稳定。第三,early-exit 修正是否会影响模型在复杂推理任务上的准确率,这决定动态计算能否真正“按需分配”而不牺牲可靠性。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28212

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注