
一句话看懂:Hugging Face 将 Nunchaku 4-bit 扩散推理引擎集成进 Diffusers 库,用户现在可以像加载普通模型一样加载量化后的文生图模型,无需额外编译,即可在消费级 GPU 上显著降低显存占用并加速推理。
事件核心:发生了什么
2026 年 7 月 23 日,Hugging Face 发布博客宣布,将背后基于 SVDQuant 方法的 Nunchaku 推理引擎以 Nunchaku Lite 形式集成到 Diffusers 库中。此前,使用 Nunchaku 量化的检查点需要依赖独立的推理库;现在,通过 from_pretrained() 即可直接加载已有模型。该集成依赖 Hugging Face 提供的 kernels 包,首次加载时自动从 Hub 下载 NVFP4 或 INT4 的 CUDA 内核,无需用户本地编译。例如,加载一个 Nunchaku NVFP4 版本的 ERNIE-Image-Turbo 模型,在 RTX 5090 上生成 1024×1024 的图像只需约 1.7 秒,显存占用约 12 GB,而相同 BF16 精度的基线则需约 24 GB。
为什么重要
这一集成直接降低了现代图像扩散大模型在消费级 GPU 上的部署门槛。当前多数量化方案(如 bitsandbytes)是权重量化,虽降低显存但并未提升推理速度甚至可能引入额外延迟。SVDQuant 采用 W4A4(4-bit 权重与激活)方法,将激活值中的异常点通过低秩分支转移到权重中,再对剩余残差进行 4-bit 量化,并通过融合内核消除内存访问开销,从而在减少显存占用的同时加速去噪循环。Nunchaku Lite 的出现意味着这类高性能硬件量化方案从独立工具走向标准生态,开发者无需学习额外推理库即可使用。
对用户/开发者/创作者的影响
对于 AI 内容创作者和开发者,最直接的好处是显存和速度双优化:一张 RTX 5090 即可高效运行过去需要 24 GB 显存起步的模型,且无需手动编译 CUDA 内核。Nunchaku Lite 还提供了 diffuse-compressor 工具包,支持用户自行量化新架构并发布为标准 Diffusers 仓库,进一步降低了量化工作的门槛。不过需注意,NVFP4 格式目前仅支持 NVIDIA Blackwell GPU(RTX 50 系列等),较老的 GPU 只能使用 INT4 变体,具体兼容性需查阅官方硬件支持表。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Nunchaku Lite 后续是否会支持更多模型架构(如视频生成、音频生成模型)并覆盖更多 GPU 平台,将决定其生态扩展速度。第二,随着 Blackwell 系列 GPU 逐步普及,NVFP4 格式带来的性能优势是否会吸引更多模型发布原生 Nunchaku 量化版,影响开发者的模型选型。第三,同类方案(如 torchao 和 Quanto)是否会跟进 W4A4 级别优化,值得持续观察。


