GRACE压缩视频生成潜空间,Wan2.1-I2V延迟降11.1倍

一篇新论文提出 GRACE 两阶段框架,将预训练视频自编码器压缩到更少 token,同时保持与原有 DiT 的兼容,在 480x832x81 条件下把 Wan2.1-I2V-14B 的 token 数减少 8 倍、延迟降低 11.1 倍。

一句话看懂:一篇新论文提出 GRACE 两阶段框架,将预训练视频自编码器压缩到更少 token,同时保持与原有 DiT 的兼容,在 480x832x81 条件下把 Wan2.1-I2V-14B 的 token 数减少 8 倍、延迟降低 11.1 倍。

事件核心:发生了什么

根据 Hugging Face Papers 在 2026 年 10 月 7 日收录的论文摘要,研究者提出 Generation-Aware Latent Compression(GRACE),目标是加速视频扩散模型。视频 DiT 的推理成本与 token 数高度相关,因此使用更高压缩比的自编码器可以直接减少 token。但压缩比升高会损害重建质量,并且压缩后的 latent 分布与预训练 DiT 所学分布不一致,重新训练或适配 DiT 代价很高。

GRACE 的做法是两阶段:先冻结预训练编码器提供的基础 latent,再学习一个残差 latent 来补回强压缩丢失的信息;同时把压缩 latent 对齐到冻结 DiT 的特征空间,使自编码器优化目标偏向生成而非仅重建。第二阶段用轻量微调与非对称去噪适配 DiT,让 base 先于 residual 去噪。摘要给出的数据是:在 480x832x81 下,Wan2.1-I2V-14B 的 token 数减少 8 倍、延迟降低 11.1 倍,并在 VBench 上匹配压缩前流水线的生成质量。

为什么重要

视频生成模型当前最大的工程约束之一是算力与延迟。Wan2.1-I2V-14B 属于较大规模的开源视频生成模型,8 倍 token 压缩和 11.1 倍延迟下降如果可复现,会直接影响推理成本结构:同样的 GPU 资源可以服务更多请求,或把高分辨率、更长时长视频的生成门槛拉低。更关键的是,GRACE 试图解决“压缩后 DiT 不兼容”的问题,而不是从头训练一个新 DiT。这条路线如果成立,意味着已有开源视频模型可以较低成本被加速改造,而不是被新模型替代。

目前公开信息仅来自论文摘要,尚未核验全文实验与第三方复现,因此不宜把 11.1 倍视为稳定产品性能。

对用户/开发者/创作者的影响

对开发者来说,GRACE 的思路值得跟踪:它把“重建友好”的压缩目标改成“生成友好”的特征对齐,可能影响后续视频自编码器、DiT 微调和推理优化工具链的设计。如果代码或权重后续开源,围绕 Wan2.1 的推理服务、本地部署和云 API 成本都可能被重新评估。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和普通用户,短期影响更可能是间接的:视频生成工具若采用类似压缩方案,等待时间、可生成分辨率或每段视频的定价有望改善。但论文摘要不等于已经上线的产品功能,实际体验取决于后续是否开放权重、推理框架是否支持以及硬件适配情况。

值得关注的后续

第一,GRACE 是否释放代码、压缩后自编码器权重或与 Wan2.1 配套的微调脚本;第二,8 倍 token 压缩和 11.1 倍延迟下降能否在第三方环境复现,尤其是不同分辨率、时长和批量推理下的表现;第三,其他视频生成模型与推理框架是否会跟进类似的“生成感知”压缩路线,从而改变开源视频模型的部署成本。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28095

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注