用 LFM2.5-VL-DSpark 加速视觉语言模型

LiquidAI 为视觉语言模型 LFM2.5-VL-3B 推出实验性 DSpark 草稿模型,用投机解码把解码速度最高提升 3.13 倍,参数量仅增加 8.9%,并首日支持 llama.cpp、MLX-VLM 和 SGLang。

一句话看懂:LiquidAI 为视觉语言模型 LFM2.5-VL-3B 推出实验性 DSpark 草稿模型,用投机解码把解码速度最高提升 3.13 倍,参数量仅增加 8.9%,并首日支持 llama.cpp、MLX-VLM 和 SGLang。

事件核心:发生了什么

2026 年 9 月 24 日,LiquidAI 在 Hugging Face 博客发布实验性 DSpark 草稿模型,配套其视觉语言模型 LFM2.5-VL-3B。该草稿模型约 2.8 亿参数,在 3B 目标模型基础上增加 8.9% 的参数量,换取明显的解码加速。

实测数据:在 M5 Max 上用 MLX 解码提速 2.30x 至 3.13x,端到端延迟改善 1.56x 至 2.62x;在 M3 Ultra 上用 llama.cpp 解码提速 1.57x 至 2.14x;在 H100 上解码提速最高 2.66x。评测覆盖通用 VQA、文本 VQA、图像描述、图表 VQA、复杂推理和多轮对话六类任务。

技术上,草稿模型沿用文本版 DSpark 架构:4 层注意力结构、块大小 9(推理时推荐 8 或 9),在固定层捕获目标模型隐藏状态来预测候选 token。图像 patch 和文本 token 被投影到同一表征空间,因此推理算法与纯文本版本一致。llama.cpp、MLX-VLM、SGLang 均已在发布当天提供支持。

为什么重要

视觉语言模型的推理瓶颈不只在解码,还在于图像编码和预填充。原文明确提到 Amdahl 定律的约束:投机解码只加速解码,如果预填充和视觉编码已占据大部分耗时,整体收益就有限。这解释了为何 H100 上解码提速可达 2.66x,而端到端只有 2.27x。

值得留意的是其效率取舍——用不到 9% 的额外参数换取 2-3 倍解码加速,且不改变输出质量。对边缘设备和本地部署场景,这意味着在有限显存下也能获得可感知的交互速度提升。同时,首日接入三个主流开源推理框架,表明 LiquidAI 在争夺开源 VLM 的开发者生态位。

对用户/开发者/创作者的影响

开发者可直接在 SGLang 中通过 --speculative-algorithm DSPARK 挂载草稿模型,或用 llama.cpp、MLX-VLM 对应构建运行,接口层是 OpenAI 兼容端点,迁移成本较低。对本地部署小模型做多模态应用(如截图问答、图表理解、图文客服)的团队,这项优化能直接缩短用户等待时间。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

创作者端的影响偏间接:推理更快意味着交互式图文工具响应更流畅,但该模型定位于 3B 级别,复杂创意生成仍受能力上限约束。目前公开信息显示,该草稿模型为实验性质,尚未提及商用授权或成本变化,企业采购需自行评估。

值得关注的后续

一是官方是否放出更多硬件(如消费级 GPU、其他 Apple 芯片)的端到端基准;二是 DSpark 是否会扩展到更大参数量的 VLM,以及草稿模型的训练成本能否被社区复现;三是随着推理框架合入相关 PR,实际部署中的稳定性与长上下文表现是否达到宣传水平。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 25339

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注