将Nunchaku 4位扩散推理引入Diffusers

Hugging Face 将 Nunchaku 4-bit 扩散推理引擎集成进 Diffusers 库,用户现在可以像加载普通模型一样加载量化后的文生图模型,无需额外编译,即可在消费级 GPU 上显著降低显存占用并加速推理。

将Nunchaku 4位扩散推理引入Diffusers

一句话看懂:Hugging Face 将 Nunchaku 4-bit 扩散推理引擎集成进 Diffusers 库,用户现在可以像加载普通模型一样加载量化后的文生图模型,无需额外编译,即可在消费级 GPU 上显著降低显存占用并加速推理。

事件核心:发生了什么

2026 年 7 月 23 日,Hugging Face 发布博客宣布,将背后基于 SVDQuant 方法的 Nunchaku 推理引擎以 Nunchaku Lite 形式集成到 Diffusers 库中。此前,使用 Nunchaku 量化的检查点需要依赖独立的推理库;现在,通过 from_pretrained() 即可直接加载已有模型。该集成依赖 Hugging Face 提供的 kernels 包,首次加载时自动从 Hub 下载 NVFP4 或 INT4 的 CUDA 内核,无需用户本地编译。例如,加载一个 Nunchaku NVFP4 版本的 ERNIE-Image-Turbo 模型,在 RTX 5090 上生成 1024×1024 的图像只需约 1.7 秒,显存占用约 12 GB,而相同 BF16 精度的基线则需约 24 GB。

为什么重要

这一集成直接降低了现代图像扩散大模型在消费级 GPU 上的部署门槛。当前多数量化方案(如 bitsandbytes)是权重量化,虽降低显存但并未提升推理速度甚至可能引入额外延迟。SVDQuant 采用 W4A4(4-bit 权重与激活)方法,将激活值中的异常点通过低秩分支转移到权重中,再对剩余残差进行 4-bit 量化,并通过融合内核消除内存访问开销,从而在减少显存占用的同时加速去噪循环。Nunchaku Lite 的出现意味着这类高性能硬件量化方案从独立工具走向标准生态,开发者无需学习额外推理库即可使用。

对用户/开发者/创作者的影响

对于 AI 内容创作者和开发者,最直接的好处是显存和速度双优化:一张 RTX 5090 即可高效运行过去需要 24 GB 显存起步的模型,且无需手动编译 CUDA 内核。Nunchaku Lite 还提供了 diffuse-compressor 工具包,支持用户自行量化新架构并发布为标准 Diffusers 仓库,进一步降低了量化工作的门槛。不过需注意,NVFP4 格式目前仅支持 NVIDIA Blackwell GPU(RTX 50 系列等),较老的 GPU 只能使用 INT4 变体,具体兼容性需查阅官方硬件支持表。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,Nunchaku Lite 后续是否会支持更多模型架构(如视频生成、音频生成模型)并覆盖更多 GPU 平台,将决定其生态扩展速度。第二,随着 Blackwell 系列 GPU 逐步普及,NVFP4 格式带来的性能优势是否会吸引更多模型发布原生 Nunchaku 量化版,影响开发者的模型选型。第三,同类方案(如 torchao 和 Quanto)是否会跟进 W4A4 级别优化,值得持续观察。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 14839

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注