MC-Sparse:扩散Transformer稀疏注意力加速最高2.32倍且画质几乎无损

一篇发布于 Hugging Face Papers 的论文提出 MC-Sparse,这是一种免训练稀疏注意力框架,声称在不明显损失生成质量的前提下,让扩散 Transformer 的视频与 3D 生成去噪速度最高提升 2.32 倍。

一句话看懂:一篇发布于 Hugging Face Papers 的论文提出 MC-Sparse,这是一种免训练稀疏注意力框架,声称在不明显损失生成质量的前提下,让扩散 Transformer 的视频与 3D 生成去噪速度最高提升 2.32 倍。

事件核心:发生了什么

2026 年 10 月 5 日,Hugging Face Papers 收录了一篇关于扩散 Transformer 长序列生成加速的论文。作者指出,稀疏注意力是降低视频、高分辨率 3D 资产生成延迟的主要手段,但现有方法在高稀疏度下会损害生成质量与保真度。通过受控的 oracle 对比实验,作者将退化归因于三个来源:token 分组带来的约束、交互选择不准确,以及被丢弃 token 所损失的注意力贡献。

据此,论文提出 Meta-Cached Sparse Attention(MC-Sparse):它不训练模型,而是按单个 key-value token 进行选择,同时把相似 query 组织成 tile 对齐的分组,以便 GPU 高效执行。该框架还会缓存元数据,包括 query 分组、基于精确注意力概率选出的 KV 索引,以及稠密与稀疏注意力输出之间的残差,并在后续去噪步骤中复用。摘要给出的数据是:相对稠密注意力,在 Minimax-H3-Base 上实现 1.80 倍去噪加速,在 3D 资产生成上实现 2.32 倍加速,且质量损失可忽略。

为什么重要

视频和 3D 生成是当前大模型推理成本最高的场景之一,长序列注意力直接决定延迟和算力开销。如果免训练稀疏注意力能在高稀疏度下保持画质,它可能成为现有扩散 Transformer 推理管线的一种低成本加速选项,而不必重新训练或蒸馏模型。这对开源模型社区尤其有意义:MC-Sparse 不绑定特定权重,理论上可以叠加到已有视频、3D 生成模型上。

不过需要强调,以上均出自论文摘要,目前公开信息显示尚未经过同行评审,也没有官方产品化或 API 上线消息,因此不宜把它当作已经落地的商业服务来解读。

对用户/开发者/创作者的影响

对开发者和创作者来说,最直接的看点是推理成本。若 MC-Sparse 的缓存复用在真实工作负载中成立,使用视频生成模型或 3D 资产模型的个人与企业,可能在同样 GPU 上获得更高吞吐,或在同等延迟下生成更长、更高分辨率的序列。对部署方而言,免训练特性意味着不必重新准备训练数据或微调权重,工程接入门槛相对较低。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

但目前公开信息只有摘要,缺少显存占用、batch size、不同分辨率下的完整对比,也未说明是否兼容主流推理框架。实际收益仍需以复现结果为准。

值得关注的后续

第一,论文是否公开代码与完整评测,尤其是在更多视频和 3D 模型上的可复现数据;第二,Minimax-H3-Base 等模型方或推理框架是否会集成该思路;第三,在商品级视频生成和 3D 内容生产中,稀疏注意力方案的画质与稳定性是否经得起长时间验证。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28538

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注