循环层叠Transformer:序列越长算得越深,八层结构在算法任务上超越标准模型

新论文提出循环层叠Transformer(RLT),把每token的固定计算深度改成随序列长度增长的循环结构,在6个算法任务上对比标准Transformer取得明显优势,但信息仅来自论文摘要,尚无产品落地。

一句话看懂:新论文提出循环层叠Transformer(RLT),把每token的固定计算深度改成随序列长度增长的循环结构,在6个算法任务上对比标准Transformer取得明显优势,但信息仅来自论文摘要,尚无产品落地。

事件核心:发生了什么

据Hugging Face Papers于2026年10月6日展示的论文摘要,研究者提出循环层叠Transformer(Recurrent Looped Transformer,RLT)。标准Transformer对每个token施加的层数是固定的,但状态跟踪需要每步输入都更新。RLT把层分为并行因果编码器和循环解码器:每个token上,解码器将编码器输出与前一token的最终解码器状态合并,从而让计算路径随序列长度增长,而每token成本保持不变。

实验对比了8层Transformer与8层的5种RLT切分方案,各跑3个随机种子,覆盖6个算法任务。训练最多40位时,两种RLT切分在256位奇偶校验任务上全部种子达到100%准确率,标准Transformer停留在随机水平;在8倍训练长度的S_5置换跟踪上,RLT最终状态准确率达97%,标准Transformer不足1%;在超出训练长度的模运算上,RLT最高93%,标准Transformer为33%。消融显示收益依赖反馈连接:去掉反馈后,奇偶校验和S_5任务在所有切分上都跌回随机水平。

为什么重要

目前主流大模型靠堆层数、堆参数提升能力,推理时每个token的计算量基本固定。RLT的思路是让模型在序列维度上做循环,用固定参数和固定单token成本换取随长度增长的有效深度。这在算法推理、状态跟踪、长序列任务上有潜力,也呼应了行业对推理时计算(test-time compute)和循环/递归架构的探索。若后续被验证,可能影响长上下文大模型的架构选择,降低部分场景对超深层网络的依赖。但目前信息仅限摘要,未说明是否经过同行评审、是否有完整实验代码或落地产品。

对用户/开发者/创作者的影响

对开发者而言,RLT提出的循环反馈机制如果被后续工作复现,可能成为一种低成本增强长序列推理的改造选项,尤其适合需要跟踪状态、执行多步算法的AI应用。摘要中提到,把反馈更新改为每4个token一次的块状更新,可以让块内已知token并行,64位奇偶校验仍保持99%,但S_5置换跟踪从100%降到20%,说明不同任务对反馈粒度的敏感度不同。这意味着实际选型需要按任务权衡并行效率和精度。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户和创作者,短期内没有直接可用的API或产品变化。该研究更偏底层架构,现阶段影响的是模型设计方向,而不是内容生成工具的功能更新。企业采购或投资判断也不宜据此调整,因为还没有可核验的产品化证据。

值得关注的后续

一是论文是否公开完整实验、代码和训练细节,以及是否通过同行评审;二是循环层叠结构能否在更大规模、真实语言任务上复现同类增益,而不只是算法玩具任务;三是是否有开源或闭源模型团队跟进这一架构,将其转化为可用的推理优化方案。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28107

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注