一句话看懂:Hugging Face 让 transformers 库可以直接加载 llama.cpp 的 GGUF 量化模型,用熟悉的 from_pretrained API 就能在本地跑推理,性能接近 llama.cpp。
事件核心:发生了什么
2026 年 9 月 22 日,Hugging Face 宣布 transformers 新增对 GGUF 模型的高效支持。用户只需在 from_pretrained 中传入 Hub 上的 model_id 和 gguf_file 文件名,即可加载 llama.cpp 生态的量化检查点并直接生成。为贴近 llama.cpp 的性能,团队通过 kernels 库复用其底层 ggml 内核,并优化了 generate 的调度开销。目前初始支持聚焦 Apple Silicon 本地推理,从 Qwen3.5 架构起步。
GGUF 由 llama.cpp 团队开发,把模型权重、tokenizer 信息与可选聊天模板打包进单一文件,并提供多种量化等级。以 Unsloth 的 Qwen3.5-4B 为例:BF16 为 8.42 GB,Q6_K 为 3.53 GB,Q5_K_M 为 3.14 GB,推荐的 Q4_K_M 仅 2.74 GB。官方建议从 Q4_K_M 起步,内存充裕再考虑 Q5_K_M 或 Q6_K。
为什么重要
llama.cpp 是 Ollama、LM Studio、Jan 等本地 AI 工具的推理引擎,GGUF 模型在 Hub 上被下载数百万次,Unsloth、LM Studio Community、bartowski 等发布者已提供大量现成量化版本。transformers 直接兼容这一格式,等于把本地推理的主流权重生态接入最广泛使用的模型加载 API,减少了格式转换和工具链割裂。对开源本地推理路线而言,这是一次生态内的重要缝合,而非另起炉灶。
对用户/开发者/创作者的影响
开发者可以在不离开 transformers 的前提下,直接选用为笔记本内存量身定制的 GGUF 检查点,且加载后的一切操作仍走标准 API,也能通过 transformers serve 暴露 OpenAI 兼容接口。前提条件目前公开信息显示为:Apple Silicon Mac、受 ggml-quantization 内核构建支持的 PyTorch 版本(通常为最近两个版本)、最新 transformers 及兼容的 kernels。若内核拉取失败,会回退到 sdpa 并给出警告,也可手动指定。对创作者和普通用户而言,选择本地模型时不再被框架绑定,量化文件可直接复用。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是当前仅覆盖 Apple Silicon 与 Qwen3.5,后续是否扩展到 CUDA 及其他主流架构;二是性能承诺能否在更多模型和量化等级上稳定成立;三是当 transformers 与 llama.cpp 共用 ggml 内核后,本地推理工具链的分工与竞争格局会如何演变。


