一句话看懂:Liquid AI 发布基于量化感知蒸馏(QAD)技术的 LFM2.5 系列 Q4_0 检查点,在保持 Q4_0 内存和速度不变的前提下,恢复了约 97% 因量化损失的 BF16 基准性能,让小模型在边缘设备上跑得更聪明。
事件核心:发生了什么
8 月 19 日,Liquid AI 在 Hugging Face 上发布了四款 LFM2.5 模型的 QAD Q4_0 GGUF 检查点,覆盖 LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct 和 LFM2.5-2.6B。这些检查点并非传统后训练量化(PTQ)产物,而是通过量化感知蒸馏训练得到:由高精度 BF16 教师模型将知识蒸馏到量化学生模型中,从而在 Q4_0 的存储和推理开销下获得更高精度。
官方基准测试显示,QAD 检查点相比 PTQ 版本显著提升,分别保留了 BF16 基线性能的 97.1%、96.5%、97.4% 和 96.6%。在硬件实测中,230M 和 350M 的 QAD Q4_0 在解码吞吐上比同质量 Q5_K_M 检查点快 4-33%;1.2B 和 2.6B 版本则比 Q4_K_M 快 3-14%。测试覆盖 MacBook Pro、NucBox EVO-X2、三星 Galaxy S26 Ultra 和树莓派 5 等设备。
为什么重要
这项发布的实质是将“量化”从部署阶段的妥协手段,升级为训练阶段的设计目标。传统 PTQ 在压缩到 Q4_0 时通常会有明显的精度折损,开发者不得不在更小的内存占用和更高的推理质量之间做取舍。QAD 让 Q4_0 的精度逼近更高比特位宽,意味着开发者不再需要为了质量而升级到 Q5 或 Q6 格式,也不必为此牺牲推理速度。
对 AI 行业而言,这一路线对边缘计算和端侧部署有直接意义。当前大模型竞争正从“能跑”转向“跑得轻、跑得快”,量化感知蒸馏提供了一条不改变模型架构、不增加推理成本,仅通过训练阶段改进就能提升质量的技术路径。Liquid AI 选择将其直接开源到 Hugging Face,也在客观上给后训练量化社区设定了新的质量参照系。
对用户/开发者/创作者的影响
如果你在使用 llama.cpp 或其他支持 GGUF Q4_0 格式的运行时,现在可以直接替换文件,不需要修改代码或调整推理参数。Liquid AI 给出了具体调用示例,例如通过 llama-cli -hf LiquidAI/LFM2.5-350M --hf-file LFM2.5-350M-QAD-Q4_0.gguf 即可运行。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者的实际收益是显而易见的:在树莓派、手机或迷你主机这类算力和内存受限的设备上,可以在保持高吞吐的同时获得更好的指令遵循和工具调用能力。对于依赖本地推理的隐私敏感型应用或实时交互场景,QAD Q4_0 可能在部署成本不变的情况下直接带来体验提升。创作者和中小团队如果依赖端侧推理,也能以同样的硬件预算换取更高的模型质量。
值得关注的后续
第一,QAD 训练流程是否会开放为通用工具——如果 Liquid AI 发布训练代码或开源框架,其他模型厂商也能复用这一方法,那时行业影响会从单家模型扩展到整个开源生态。
第二,2.6B 以上更大规模模型(如 7B、13B 级别)能否延续 97% 的精度恢复率尚无公开数据,这是判断该技术是否具备普适性的关键一步。
第三,Unsloth 等第三方后训练量化方案已经出现在对比表中且表现不俗,QAD 与外部 PTQ 方案之间的差距是否会推动量化工具链整体升级,值得持续观察。


