Naver 提出 DLoop:循环投机解码让大模型推理再提速 5% 至 41%

Naver AI 团队在 Hugging Face Papers 公开论文,提出循环式投机解码方法 DLoop,让草稿模型在验证前多跑几轮,把推理加速再提升 5% 到 41%,同时保持无损解码。

一句话看懂:Naver AI 团队在 Hugging Face Papers 公开论文,提出循环式投机解码方法 DLoop,让草稿模型在验证前多跑几轮,把推理加速再提升 5% 到 41%,同时保持无损解码。

事件核心:发生了什么

论文于 2026 年 10 月 6 日发布在 Hugging Face Papers。作者观察到,随着草稿模型能力增强,目标模型经常一次性接受某个起草阶段生成的全部 token,但每个起草阶段后仍会触发一次验证,造成不必要的目标模型前向计算。

DLoop 的做法是把投机解码改成循环结构:只要草稿模型仍然置信,就继续起草,最后把所有累积的草稿 token 一起交给目标模型验证。为了让草稿模型在额外起草阶段保持可靠,作者引入 loop-aware training,让它在训练中接触到未验证草稿 token 的自身隐藏状态。据摘要,该方法在 EAGLE-3、DFlash、Domino、DSpark 以及多 token 预测模块等不同投机解码方法上,wall-clock 加速提升 5% 到 41%,且保持无损解码。代码将发布于 GitHub 的 naver-ai/DLoop 仓库。

为什么重要

大模型推理成本和延迟直接决定应用体验与商业可行性。投机解码已经是主流加速手段之一,但验证环节的固定开销限制了收益上限。DLoop 试图从“何时验证”这个环节要效率,而不是只堆更大的草稿模型。目前公开信息显示,它属于论文层面的方法研究,是否适合生产环境、显存占用和批量推理下的表现,还需要看完整实验与代码实现。

对用户/开发者/创作者的影响

对开发者而言,如果 DLoop 能顺利落地到 EAGLE-3 等已有推理框架,可能意味着同等算力下更低的生成延迟,尤其在长文本生成、代码补全等场景。对使用 API 或自部署大模型的产品团队,这类优化通常不会改变模型输出质量,但会直接影响单位 token 的推理成本。创作者端短期感知有限,但如果推理服务商跟进,对话响应速度和长内容生成效率有望改善。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是代码开源后,社区能否复现摘要中的加速区间,并验证在不同模型规模与硬件上的表现;二是主流推理框架如 vLLM、TensorRT-LLM 是否集成类似循环起草机制;三是闭源模型厂商是否会把这类方法用于自家推理服务,从而间接影响 API 价格与延迟。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28421

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注