A Princeton Researcher Proposes Recurrent Looped Transformer (RLT) that Carries Decoder State across Every Token, Fixing 96 Blocks per Token with Unbounded Temporal Depth

普林斯顿研究者提出 Recurrent Looped Transformer(RLT),把解码器状态在生成每个 token 时持续携带,并对每个 token 固定执行 96 个模块的循环计算,用“无界时间深度”替代单纯堆叠层数。它值得关注,因为这是在挑战大模型扩容的一个基础假设:性能提升是否只能靠更多参数和更…

一句话看懂:普林斯顿研究者提出 Recurrent Looped Transformer(RLT),把解码器状态在生成每个 token 时持续携带,并对每个 token 固定执行 96 个模块的循环计算,用“无界时间深度”替代单纯堆叠层数。它值得关注,因为这是在挑战大模型扩容的一个基础假设:性能提升是否只能靠更多参数和更深网络。

事件核心:发生了什么

据 MarkTechPost Research 报道,一位普林斯顿研究者提出 Recurrent Looped Transformer(RLT)架构。其关键设计有两点:一是解码器状态会跨每个 token 持续传递,而不是在单步生成后丢弃;二是每个 token 都要经过 96 个模块的循环计算,形成可反复迭代的时间深度。目前公开信息显示,该工作仍属研究提案,尚无大规模预训练结果或产品化细节。

为什么重要

当前大模型的主流扩容路径是增加参数量、层数和训练数据,代价是算力与显存开销同步上升。RLT 的思路是把“深度”从静态层数变成可循环的推理过程,理论上让模型在推理阶段用更多计算步数换更强的表达与推理能力。如果成立,这会直接影响训练与推理的性价比讨论:闭源模型可以继续堆算力,而开源模型或许能在参数受限时靠循环深度补足能力。它也与近期业界对循环 Transformer、推理时计算扩展等方向的探索相呼应。

对用户/开发者/创作者的影响

对普通用户,短期内使用体验不会有变化,因为还没有可调用的 API 或开源权重。对开发者,值得留意的是推理成本结构可能改变:固定 96 个模块的循环意味着每个 token 的计算量显著高于常规解码,服务端延迟和显存占用需要重新评估。对创作者而言,如果该类架构能提升长链推理和一致生成能力,未来在代码、长文与多步图像生成等场景可能受益,但目前仍停留在论文层面。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是是否公开可复现的实验数据,尤其是与同参数规模基线模型的对比;二是循环深度增加后,推理延迟和算力成本是否可被工程优化消化;三是是否有开源社区或大厂跟进,把循环解码器状态带入实际训练框架与推理引擎。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 23276

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注