Liquid AI发布LFM2.5-DSpark草稿模型,解码速度最高提升3.18倍,且不改变模型输出

Liquid AI 发布 LFM2.5-DSpark 草稿模型,通过投机解码的方式让推理解码速度最高提升 3.18 倍,且不改变原模型的输出结果。这项优化直接降低了大模型推理的延迟和算力成本,对依赖 API 调用或自部署模型的开发者和企业尤其有价值。

一句话看懂:Liquid AI 发布 LFM2.5-DSpark 草稿模型,通过投机解码的方式让推理解码速度最高提升 3.18 倍,且不改变原模型的输出结果。这项优化直接降低了大模型推理的延迟和算力成本,对依赖 API 调用或自部署模型的开发者和企业尤其有价值。

事件核心:发生了什么

Liquid AI 于近期发布了 LFM2.5-DSpark 草稿模型。该模型并非独立的大模型,而是作为加速模块,配合原模型使用。其核心机制是推测解码(Speculative Decoding):草稿模型先生成候选 token,再由主模型进行校验,从而在不改动主模型权重和输出分布的前提下,显著减少逐 token 生成所需的串行步骤。

根据公开信息,LFM2.5-DSpark 在解码速度上最高可提升 3.18 倍。由于草稿模型体积远小于主模型,整个推理过程的显存占用和计算开销也相对可控。Liquid AI 强调,这一加速方式是“无损”的——即最终生成的文本内容与未加速时保持一致,不牺牲质量换取速度。

为什么重要

在大模型应用中,推理阶段的速度和成本是制约规模化落地的关键瓶颈。相比训练阶段的一次性投入,推理是持续发生的算力开销。LFM2.5-DSpark 采用投机解码路线,意味着厂商可以在不更换硬件、不压缩模型、不牺牲输出质量的情况下获得接近三倍的解码吞吐提升。这为闭源 API 服务和本地私有化部署都提供了新的优化空间。

从行业竞争角度看,Liquid AI 选择以“草稿模型+投机解码”切入,而非单纯堆参数或做模型压缩,体现出推理效率赛道的差异化竞争思路。这也说明大模型竞争正在从“模型能力”向“单位算力产出”延伸,推理优化将成为未来模型生态中不可忽视的技术壁垒。

对用户/开发者/创作者的影响

对于使用 API 的开发者,解码速度的提升直接降低了接口响应时间,也让并发处理能力更强,从而减少排队等待概率。尤其在需要多轮交互、长文本生成或实时流式输出的场景中,体验改善会比较明显。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于自部署模型的企业,3.18 倍的解码加速意味着在同等 GPU 资源下可以支撑更多用户请求,或者用更少的显卡完成原有业务量,这有助于降低推理环节的硬件投入和电费支出。创作者如果使用底层 API 进行文字或内容生成,也能在相同等待时间内尝试更多次的改写与迭代。

目前公开信息显示,该项技术适配的具体主模型范围、是否支持开源模型接入、以及调用方式的变更细节尚未全面披露,建议有集成意愿的开发者先确认模型兼容列表。

值得关注的后续

1. 模型开放方式:LFM2.5-DSpark 是否提供开源权重、能否与主流开源大模型直接配合使用,决定了它能否形成开发者生态。

2. 实际性能复现:官方给出的 3.18 倍是峰值数据,在长上下文、多轮对话、批处理等不同负载下的真实加速表现,需要等第三方基准测试验证。

3. 竞品跟进:OpenAI、Anthropic、Google 等头部厂商也在探索 speculative decoding 和 continuous batching 等推理优化手段,Liquid AI 的这条路线是否会成为行业标准,值得持续观察。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 19367

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注