DMAD 新蒸馏框架:一步生成 ImageNet-64 FID 1.04,四步 SDXL 达 14.47

Hugging Face Papers 收录的论文提出 DMAD,把分布匹配重写成对抗式分类蒸馏,省去辅助扩散模型,在一步和少步视觉生成上刷新了 FID 与 VBench 成绩。

一句话看懂:Hugging Face Papers 收录的论文提出 DMAD,把分布匹配重写成对抗式分类蒸馏,省去辅助扩散模型,在一步和少步视觉生成上刷新了 FID 与 VBench 成绩。

事件核心:发生了什么

2026 年 10 月 1 日,论文 DMAD: Distribution Matching as Adversarial Distillation for Fast Visual Generation 出现在 Hugging Face Papers。它针对的是 DMD(Distribution Matching Distillation):DMD 需要额外维护一个拟合学生分布变化的辅助扩散模型,显存和算力开销都不低。DMAD 的做法是把分布匹配转成分类问题,在共享骨干上挂两个判别器头,分别区分真实数据与教师样本、以及学生样本,再用 logits 上的线性损失训练学生模型,不再需要辅助分数拟合。作者证明了在判别器最优时,这套损失能还原 DMD 的分布匹配梯度,并引入基于 gap 的重加权,按噪声水平自适应调整教师监督。摘要给出的成绩包括:ImageNet-64×64 一步生成 FID 1.04,COCO-10K 上四步 SDXL FID 14.47,四步 Wan2.1-T2V-14B 的 VBench 总分 85.15;在 MiniMax-H3-33B 联合音视频生成上,四步学生相对 DMD2 人类偏好率 79.1%、相对 rCM 为 84.6%(不计平局)。代码、模型和 demo 已公开。

为什么重要

少步生成是图像和视频模型降本的关键方向,但 DMD 类方法一直背着辅助模型的包袱。DMAD 把问题搬到判别器框架下,理论上不牺牲分布匹配目标,工程上则可能减少训练显存和推理链路复杂度。如果结论在更大规模上成立,它会直接影响开源图像生成、视频生成乃至音视频联合生成模型的蒸馏方案选择,也会让“一步出图”“四步出视频”这类产品形态更接近可落地的成本结构。目前公开信息显示,这些数字来自论文摘要,尚未经过同行评审,也未核验全文实验细节。

对用户/开发者/创作者的影响

对开发者和研究者,DMAD 提供了替代 DMD 的蒸馏思路,代码和模型已放出,适合在自有数据上验证显存占用和收敛速度。对创作者和 AI 应用团队,少步生成意味着更低推理成本:如果四步 SDXL、四步 Wan2.1 的成片质量能在实际工作流中复现,视频和图像工具的生成延迟、API 计费都可能被重新压缩。音视频联合生成方向的偏好率数据,则提示多模态生成模型也存在被蒸馏加速的空间,但需要更多第三方评测确认。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 DMAD 能否在更大参数量、更高分辨率任务上保持 FID 和 VBench 优势,而不只是摘要中的评测条件;二是社区是否复现显存节省和训练稳定性,尤其是判别器头带来的额外调参成本;三是闭源与开源视频生成模型是否跟进类似的对抗式蒸馏路线,以及四步学生模型会不会先出现在开源推理框架和 API 服务里。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28061

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注