LiFT循环流Transformer:推理时可扩展深度,少60%参数超越DiT-XL/2

2026年10月4日发布的论文提出LiFT(Loop Flow Transformers),通过让扩散Transformer在推理时重复执行共享模块来扩展计算深度,无需重训即可用更少参数超越更大的密集模型,ImageNet 256x256上FID比DiT-XL/2低3.34。

一句话看懂:2026年10月4日发布的论文提出LiFT(Loop Flow Transformers),通过让扩散Transformer在推理时重复执行共享模块来扩展计算深度,无需重训即可用更少参数超越更大的密集模型,ImageNet 256×256上FID比DiT-XL/2低3.34。

事件核心:发生了什么

2026年10月4日,alphaXiv上发布了一篇论文,作者提出名为LiFT(Loop Flow Transformers)的循环生成模型。其核心是对标准DiT(Diffusion Transformer)做轻微修改:将部分网络变成可循环的核心,训练时每个循环不预测最终输出,而是预测从初始估计到流匹配目标之间直线路径上的一个点,且该点由连续深度坐标索引。这样一来,模型在推理时可以循环远超训练深度的次数,无需重新训练或提前退出。

论文在ImageNet 256×256类别条件生成任务上报告:LiFT-L/2的FID比密集DiT-XL/2基线低3.34,同时参数减少约60%、训练FLOPs减少32%、推理FLOPs减少52%。作者在社交帖文中还提到,LiFT-XL/2 R12仅用2个循环训练,推理时扩展到16个循环,FID从17.07降至9.31,实现了8倍循环深度外推。目前公开信息限于论文摘要与作者帖文,尚未见同行评审或完整实验结论。

为什么重要

扩散模型的推理计算通常靠增加采样步数(时间维度)来提升质量,而LiFT提出第二个可扩展轴:深度维度。通过循环共享参数,单一检查点可在算力紧张时少循环、算力充足时多循环,从而在不增加参数量的前提下调节生成质量。这对大模型竞争格局有两点含义:一是模型小型化与推理弹性化可能缓解参数军备竞赛,二是训练和推理FLOPs的显著降低可能降低图像生成应用的部署成本。不过,该结果目前仅限ImageNet 256×256图像生成任务,能否迁移到文生图、视频生成等更复杂场景仍需验证。

对用户/开发者/创作者的影响

对开发者而言,LiFT展示了一种“一个检查点、多种算力预算”的推理模式。若方法被后续工作验证并落地,API服务商可以按用户需求动态分配循环深度,在低成本模式下快速返回结果,高成本模式下提升质量。对图像生成创作者,这意味未来可能在相同硬件上获得更高质量的生成,或在不升级显卡的情况下运行更强大的模型。不过目前LiFT仍是研究论文,没有公开的API、产品集成或开源代码,实际使用还需等待。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

1. 方法是否会被集成到主流扩散模型框架(如Stable Diffusion、DiT变体)中,并开放代码或模型权重。
2. 在文生图、视频生成等任务上能否复现类似的参数效率优势。
3. 是否有云服务商或AI应用把“弹性循环深度”作为推理成本控制卖点,从而影响API定价模式。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 27937

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注