STEPQuant 面向 Delta 规则循环状态的分时空量化方案发布

研究者提出 STEPQuant,一种针对 Delta 规则循环状态的后训练量化框架,论文摘要称其在 6-bit 预算下接近 FP32 精度,并已在 SGLang 中集成实现超 5 倍状态压缩。

一句话看懂:研究者提出 STEPQuant,一种针对 Delta 规则循环状态的后训练量化框架,论文摘要称其在 6-bit 预算下接近 FP32 精度,并已在 SGLang 中集成实现超 5 倍状态压缩。

事件核心:发生了什么

根据 Hugging Face Papers 收录的论文摘要,研究团队提出了 STEPQuant,一个面向 Delta 规则循环状态的空间-时间后训练量化框架。该工作关注的问题是:线性注意力用固定大小的循环状态替代不断增长的 KV 缓存,但在并发服务场景下,这些持久状态本身可能成为显著的内存瓶颈。直接对循环状态做低精度量化往往导致严重的精度下降,因为量化误差会随着状态更新逐步传播。

论文称,团队发现误差影响取决于两个维度:时间上,长期记忆中的误差会持续多个解码步骤;空间上,不同 key 行的误差对模型输出的影响不同,状态幅度在行和列方向上也存在明显差异。基于这些观察,STEPQuant 按误差幅度和记忆生命周期分配精度,并联合拟合 key 行与 value 列的缩放因子。摘要提及的实验在 Qwen3.8-27B 和 Kimi-Linear-48B-A3B-Instruct 上进行,覆盖长、短生成基准;在标称 6-bit 预算下精度接近 FP32 状态,4-bit 配置优于均匀 INT8。集成到 SGLang 并配合优化 GPU 内核后,6-bit STEPQuant 实现超过 5 倍的循环状态压缩,总服务内存最多降低 68.7%。需要说明的是,以上均为论文摘要中的表述,并非已上线产品公告,也未核验全文实验细节。

为什么重要

线性注意力被业界视为缓解长上下文推理中 KV 缓存膨胀的重要路线之一,但循环状态的内存占用在并发服务时会被放大。如果状态量化能在几乎不损失精度的情况下把内存压下来,意味着同样的 GPU 可以承载更多并发请求,或把释放出的显存留给更大的模型和更长的上下文。这对推理成本、长上下文应用和线性注意力架构的工程落地都有直接影响。目前公开信息显示,该工作属于后训练量化范畴,不涉及重新训练,降低了部署门槛。

对用户/开发者/创作者的影响

对开发者而言,STEPQuant 与 SGLang 集成并提供开源代码,意味着采用线性注意力或 Delta 规则状态模型的推理服务可能获得更低的内存占用。对使用长上下文 API 的产品团队,服务端内存下降理论上可转化为更低的调用成本或更高的并发上限,但这一收益取决于推理框架和硬件是否支持。对普通用户和创作者,短期感知有限,真正的变化会体现在长文档问答、长对话等场景的响应成本和可用性上。论文摘要未披露对延迟的具体影响,实际部署效果仍需验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是代码仓库后续是否补充更多模型和硬件的复现结果;二是 SGLang 等推理框架是否把该量化方案合入主线,以及是否扩展到主流闭源模型的服务栈;三是 4-bit 配置在更长上下文和更高并发下的精度与吞吐表现是否有第三方验证。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28150

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注