一句话看懂:alphaXiv 上的一篇新论文提出 Level-of-Token(LoT)Diffusion,让扩散模型按画面细节分布分配不同大小的 token,在不重训的前提下减少 token 数量、提升生成速度,图像和视频任务都有验证。
事件核心:发生了什么
2026年10月5日,alphaXiv 收录的论文 Level-of-Token Diffusion 提出一种自适应生成框架:把图像或视频的潜在网格划分成大小不一的矩形 patch,细节多的区域用更细的 token,细节少的区域用更粗的 token,从而把原本等长的 token 序列压缩。论文称,该方法通过 patch 级非对称流参数化,让预训练扩散 Transformer 仍能在每个去噪步骤预测全分辨率 flow,但只处理缩短后的序列。布局可以来自语义掩码、边界框、纹理方差、景深线索,也可以由 agentic 计划生成。在 81 帧、1280×720、15fps 的视频测试中,论文报告 LoT-Wan2.1-14B 相比全分辨率模型取得 2.262× 加速,对比 Foveated Diffusion 的 2.153×;加速包含去噪和 VAE 解码,不含布局构建与模型加载。目前公开信息显示,这些结果来自论文实验,并非已上线产品。
为什么重要
图像和视频生成的成本大头之一,是模型反复处理长序列空间 token。LoT 的思路不是换更大的模型或更多算力,而是在生成前先决定“哪里值得算”。这对扩散模型推理效率、视频生成成本结构、以及算力受限场景下的部署都有参考价值。它保留预训练先验,兼容已经训练好的 DiT 类模型,不要求从头训练,意味着这条路线对开源模型社区和闭源 API 提供商都可能有吸引力。如果后续被主流推理框架吸收,生成价格和延迟都有望下降。
对用户/开发者/创作者的影响
对创作者来说,最直接的变化可能是同样硬件下能生成更高分辨率或更长视频,或在批量出图、出视频时降低排队时间。对开发者而言,LoT 更像一种推理层优化:布局来源灵活,可以接语义分割、目标检测、景深估计,也可以由 agent 规划,适合集成进现有文生图、文生视频管线。对采购和算力团队,它提供了一个不靠堆卡就能改善单位算力产出的方向。目前公开信息仍限于论文层面,是否开源、是否有可调用的 API、对生成质量的稳定影响,都需要等后续验证。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 LoT 是否会被 Wan、DiT 等开源视频生成项目或推理框架采纳,变成可复用的加速模块;二是布局生成本身的开销和鲁棒性,尤其在复杂场景、多主体、快速运动视频中能否稳定提速;三是 VBench 等评测中质量与效率的取舍能否在更多任务上复现。社区评论显示关注度不低,但评论不能当作论文结论,实际落地仍要看代码、权重和第三方复现。
来源:alphaXiv


