transformers 支持直接加载 GGUF 量化模型,本地推理性能接近 llama.cpp

Hugging Face 让 transformers 库可以直接加载 llama.cpp 的 GGUF 量化模型,用熟悉的 from_pretrained API 就能在本地跑推理,性能接近 llama.cpp。

一句话看懂:Hugging Face 让 transformers 库可以直接加载 llama.cpp 的 GGUF 量化模型,用熟悉的 from_pretrained API 就能在本地跑推理,性能接近 llama.cpp。

事件核心:发生了什么

2026 年 9 月 22 日,Hugging Face 宣布 transformers 新增对 GGUF 模型的高效支持。用户只需在 from_pretrained 中传入 Hub 上的 model_id 和 gguf_file 文件名,即可加载 llama.cpp 生态的量化检查点并直接生成。为贴近 llama.cpp 的性能,团队通过 kernels 库复用其底层 ggml 内核,并优化了 generate 的调度开销。目前初始支持聚焦 Apple Silicon 本地推理,从 Qwen3.5 架构起步。

GGUF 由 llama.cpp 团队开发,把模型权重、tokenizer 信息与可选聊天模板打包进单一文件,并提供多种量化等级。以 Unsloth 的 Qwen3.5-4B 为例:BF16 为 8.42 GB,Q6_K 为 3.53 GB,Q5_K_M 为 3.14 GB,推荐的 Q4_K_M 仅 2.74 GB。官方建议从 Q4_K_M 起步,内存充裕再考虑 Q5_K_M 或 Q6_K。

为什么重要

llama.cpp 是 Ollama、LM Studio、Jan 等本地 AI 工具的推理引擎,GGUF 模型在 Hub 上被下载数百万次,Unsloth、LM Studio Community、bartowski 等发布者已提供大量现成量化版本。transformers 直接兼容这一格式,等于把本地推理的主流权重生态接入最广泛使用的模型加载 API,减少了格式转换和工具链割裂。对开源本地推理路线而言,这是一次生态内的重要缝合,而非另起炉灶。

对用户/开发者/创作者的影响

开发者可以在不离开 transformers 的前提下,直接选用为笔记本内存量身定制的 GGUF 检查点,且加载后的一切操作仍走标准 API,也能通过 transformers serve 暴露 OpenAI 兼容接口。前提条件目前公开信息显示为:Apple Silicon Mac、受 ggml-quantization 内核构建支持的 PyTorch 版本(通常为最近两个版本)、最新 transformers 及兼容的 kernels。若内核拉取失败,会回退到 sdpa 并给出警告,也可手动指定。对创作者和普通用户而言,选择本地模型时不再被框架绑定,量化文件可直接复用。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是当前仅覆盖 Apple Silicon 与 Qwen3.5,后续是否扩展到 CUDA 及其他主流架构;二是性能承诺能否在更多模型和量化等级上稳定成立;三是当 transformers 与 llama.cpp 共用 ggml 内核后,本地推理工具链的分工与竞争格局会如何演变。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 24964

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注