一句话看懂:研究者提出 STEPQuant,一种针对 Delta 规则循环状态的时空后训练量化框架,在名义 6-bit 预算下让量化状态精度接近 FP32,并在 4-bit 配置下优于统一 INT8;集成到 SGLang 后可将循环状态压缩超过 5 倍,服务总内存最高减少 68.7%。该工作目前仅为论文摘要信息,尚未核验全文实验。
事件核心:发生了什么
据 Hugging Face Papers 于 2026 年 9 月 29 日收录的论文,线性注意力机制用固定大小的循环状态替代不断增长的 KV 缓存,但在并发推理服务场景下,这些持久状态本身会成为显著的内存瓶颈。直接将其量化为低精度往往导致精度严重下降,因为量化误差会在状态更新过程中逐步传播。
论文发现误差影响可分为两个维度:时间上,长期记忆中的误差会跨多个解码步骤持续存在;空间上,不同 key 行对模型输出的影响不同,且状态幅值在行和列方向差异明显。基于此,作者提出 STEPQuant,按误差幅度和记忆寿命分配精度,并联合拟合 key-row 与 value-column 的缩放因子。在 Qwen3.8-27B 和 Kimi-Linear-48B-A3B-Instruct 上,长、短生成基准测试中,6-bit STEPQuant 接近 FP32 状态精度,4-bit 配置优于统一 INT8。集成至 SGLang 并配合优化 GPU kernel 后,6-bit 版本实现超过 5 倍循环状态压缩,总服务内存最多降低 68.7%。代码已在 GitHub 开源。
为什么重要
线性注意力与 Delta 规则类结构正被越来越多地用于降低长上下文推理的 KV 缓存开销,但循环状态本身的内存占用尚未被充分解决。STEPQuant 将量化误差按“时间寿命”和“空间影响”差异化处理,而不是均匀压缩,这为推理侧内存优化提供了新思路。若其结论在更广泛模型和硬件上成立,将有助于在同等 GPU 显存下提升并发服务能力,降低长文本生成与实时推理的部署成本。
不过,目前公开信息仅限于论文摘要,尚不清楚其在不同序列长度、批大小和硬件后端上的完整表现,也不代表该方案已进入生产级产品。
对用户/开发者/创作者的影响
对开发者和推理服务运维者而言,该方向值得跟踪:如果 STEPQuant 后续在 SGLang 中稳定落地,部署线性注意力大模型时可能以更低显存支撑更高并发,尤其适合长上下文、短生成和长生成的混合负载。对使用 API 的创作者和产品团队,短期内影响有限,因为是否开放、何时开放仍取决于模型服务商。对企业采购方,评估推理成本时应关注该量化方案是否进入所购云服务或自托管框架的默认配置。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 STEPQuant 能否从论文摘要走向 SGLang 正式版本,并公开完整精度与吞吐对比;二是 6-bit 与 4-bit 配置在更多模型、更长上下文和不同 GPU 上的泛化表现;三是同类线性注意力模型是否跟进类似时空量化策略,以及开源社区能否复现其内存压缩收益。


