SparseDecoding:面向解码的剪枝方法提升大模型推理速度

一篇新论文提出 SparseDecoding,针对大模型解码阶段做剪枝校准和稀疏算子优化,在多个模型上报告了长文本生成效果提升和最高 1.48 倍的端到端解码加速。

一句话看懂:一篇新论文提出 SparseDecoding,针对大模型解码阶段做剪枝校准和稀疏算子优化,在多个模型上报告了长文本生成效果提升和最高 1.48 倍的端到端解码加速。

事件核心:发生了什么

根据 Hugging Face Papers 上公开的论文摘要(2026 年 10 月 8 日发布),研究者提出了一种名为 SparseDecoding 的剪枝框架,目标是在不重新训练模型的前提下,让大语言模型的解码(即逐字生成 token)阶段跑得更快、更准。论文指出,现有基于 Hessian 的逐层剪枝方法通常用预先收集的自然文本序列来计算重要度,但模型在实际解码时看到的是自己生成的 token,两者存在分布偏移,导致剪枝时假设的激活分布与生成时不一致,拖累了剪枝后模型的输出质量。此外,多数能带来实际加速的剪枝方法主要优化稀疏矩阵乘法(SpMM),而对解码阶段占主导的稀疏矩阵向量乘法(SpMV)支持有限。

为什么重要

大模型推理的瓶颈往往不在预填充,而在逐 token 生成的解码阶段:这一阶段受内存带宽限制,要反复从显存中读取权重。剪枝之所以重要,是因为它直接减少每次解码需要读取的非零参数,从而压缩延迟。SparseDecoding 的切入点是两个常被分开讨论的问题——校准数据的分布对不对、底层稀疏算子快不快。它把校准矩阵换成来自稠密模型自回归生成(排除预填充)的逐层激活,让剪枝目标更贴近解码时的真实激活,同时配合带位掩码索引和固定步长遍历的 N:M 稀疏矩阵向量内核。如果这类方法被主流推理框架采纳,意味着开发者在同等 GPU 上跑长文本生成时,可能获得更低的单次调用延迟或更高的吞吐。

对用户/开发者/创作者的影响

对开发者和企业来说,这类面向解码的剪枝研究如果落地,影响的是 API 调用成本和本地部署门槛。当前公开信息显示,论文在 Llama-3.1-8B、Llama-3.3-70B、Qwen3-14B / 32B 上做了实验,报告在长文本生成基准上稳定优于固定文本校准,并在 A100 GPU 上实现最高 1.48 倍端到端真实解码加速。这意味着未来推理优化可能不再只依赖换更贵的卡或更激进的量化,而是在模型压缩和内核实现层面继续挖效率。对创作者而言,更快的解码通常对应更流畅的流式输出体验,但这类收益能否传导到常用的闭源 API 或开源推理服务,目前尚无明确产品化信息。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,论文所述方法是否会被 vLLM、TensorRT-LLM 等推理框架集成,或开源为可直接调用的内核;第二,1.48 倍加速是在 A100 上、特定模型和长文本生成任务下测得的,其他硬件(如消费级 GPU、国产算力卡)和短输出场景是否同样有效,需要更多独立复现;第三,剪枝后的模型在代码、数学、多轮对话等任务上的质量保持程度,以及是否与量化、KV 缓存优化叠加使用,仍需看后续实验和社区反馈。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28538

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注