一句话看懂:Liquid AI 与 Hugging Face 联合发布 LFM2.5 系列三个核心模型的 DSpark 草稿模型,通过投机解码将 GPU 推理吞吐量最高提升 3.18 倍,且不改变模型输出质量,为边缘设备运行 agent 应用扫清了性能障碍。
事件核心:发生了什么
8月21日,Liquid AI 与 Hugging Face 正式发布了 DSpark 草稿模型的检查点,覆盖 LFM2.5 系列的三款核心模型:LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。这项技术引入了一条全新的投机解码路径,在不改变模型输出质量的前提下,显著提升推理吞吐量。
实测数据显示,DSpark 在 GPU 上可将整体吞吐量最高提升 3.18 倍,在边缘设备上最高提升 2.87 倍。尤其值得关注的是,在边缘 agent 推理场景中,LFM2.5-2.6B 的函数调用延迟平均降低了 57%。以 M4 Max MacBook Pro 作为边缘测试平台时,输出速度最高可达每秒 139 个 token,这一表现已超过部分闭源云模型。
为什么重要
大模型推理的瓶颈通常不在计算本身,而在于内存带宽——延迟主要来自将模型权重从 DRAM 流式读取到 SRAM 的过程。投机解码的思路是用一个轻量级草稿模型快速生成候选 token,再由目标模型在一次前向传播中统一验证,从而摊薄权重加载成本。
DSpark 的架构由三个核心组件构成:并行主干网络(类似 DFlash 风格,单次前向传播统一生成所有草稿 token 的隐藏状态)、序贯头(通过模拟相邻 token 间的马尔可夫链提高后续位置的接受率),以及置信度调度验证器(预测每个 token 的存活概率,在验证成本超过节省成本时自动剔除低置信度后缀)。草稿模型采用仅注意力架构,包含 5 层 9 块,总参数量控制在约 3 亿,训练数据混合了 SFT、聊天、代码和函数调用等大规模多样化语料。
这一技术路线的意义在于,它验证了在不改动目标模型的前提下,通过外围草稿模型即可大幅提升推理效率,且由于贪婪解码机制下草稿 token 必须与目标模型分布完全匹配才会被接受,输出序列与基线贪婪解码保持结构一致,所有基准测试均未出现精度下降。这对推理成本敏感的边缘部署和实时 agent 应用有直接价值。
对用户/开发者/创作者的影响
对开发者而言,DSpark 发布当天即获得主流推理框架的兼容支持:SGLang 可通过专用集成和启动配置在加速器上运行;llama.cpp 实现了官方构建支持,允许通过命令行加载对应的 GGUF 权重和草稿模型文件。这意味着开发者无需等待漫长的适配周期,即可在现有技术栈中直接体验推理加速。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户和创作者来说,更直接的感受是本地运行 agent 应用的门槛被大幅拉低。过去需要云端算力支撑的交互式应用,如今在 MacBook Pro 这类消费级设备上也能获得流畅体验,且无需联网、无需支付 API 费用,数据隐私也更有保障。
值得关注的后续
目前公开信息显示,DSpark 的加速效果在 GPU 和边缘设备上均表现亮眼,但仍有几个观察点值得跟进:
一是草稿模型的通用性——当前版本针对 LFM2.5 系列三款模型定制,未来是否会向其他开源模型家族扩展,将决定这项技术的生态覆盖范围。二是框架整合的深度——SGLang 和 llama.cpp 的初始支持是否稳定、是否能持续跟进上游版本更新,直接影响开发者的实际采用意愿。三是竞品响应——闭源云模型厂商是否会通过价格调整或推出类似加速方案来应对边缘部署体验的追赶,这将影响本地推理与云端推理的成本平衡格局。
来源:AIbase


