Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

LMSYS 与蚂蚁灵 Infra 团队公开了 Ling-3.0-flash 在 4 块 Blackwell GPU 上的推理优化细节:通过投机解码和系统性延迟拆解,将单请求解码平均 TPOT 从 3.33 ms 降至 1.53 ms(降幅 54%),并在受控对比中把 DSpark 路径推至 0.78 ms。这…

一句话看懂:LMSYS 与蚂蚁灵 Infra 团队公开了 Ling-3.0-flash 在 4 块 Blackwell GPU 上的推理优化细节:通过投机解码和系统性延迟拆解,将单请求解码平均 TPOT 从 3.33 ms 降至 1.53 ms(降幅 54%),并在受控对比中把 DSpark 路径推至 0.78 ms。这代表大模型推理在“批处理 1”场景下的延迟压榨进入新阶段。

事件核心:发生了什么

8 月 21 日,LMSYS(Chatbot Arena 团队)发布了一篇技术博客,由 RadixArk SGLang 团队与蚂蚁灵 Infra 团队撰写,详细记录了 Ling-3.0-flash(一款 42 层混合线性注意力 MoE 模型)在 4 块 NVIDIA Blackwell GPU 上的推理优化过程。优化覆盖两条投机解码路径:在 NEXTN/MTP 路径上,单请求解码吞吐从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms;另一条路径 DSpark 在 1000 请求的受控测试中达到平均 TPOT 0.78 ms、吞吐 1120 tok/s,平均接受长度 9.95。团队给出的关键优化顺序是:主机端 run-ahead、PDL 链接小算子、两项核融合与 KDA 重调,以及将 router gate 与 lm_head 从 fp32 改为 bf16(此举单独贡献约 10% 性能提升)。

为什么重要

批处理 1(batch-1)推理正在成为衡量推理栈真实水平的关键场景,因为当并发为 1 时,任何启动开销、流水线气泡或低算术强度都无法通过批大小来掩盖。这篇博客的价值在于它提供了完整的“延迟时间都去哪了”分析框架:识别出 47% 的 GPU 空转时间,并通过主机端提前准备(host run-ahead)与 PDL 链接把空转消除。对行业而言,这意味着优化方向正从“提高吞吐”转向“压低单请求延迟地板”,而 DSpark 通过置信度调度的块级草稿解码,把单步提交 token 数提升至接近 10,为低延迟推理开辟了不同于传统投机解码的路径。

对用户/开发者/创作者的影响

对于 API 调用方与 AI 应用开发者,这项优化直接指向更快的首 token 后输出体验,尤其是在智能体、编码助手等需要逐 token 反馈的交互场景中,TPOT 从 3.33 ms 降至 1.53 ms 意味着更接近“实时”的响应节奏。对于推理服务提供商,博客提供了一个可复现的方法论:先做 profiled-vs-unprofiled 校准,再做 A/B 决策,且所有结论基于平均 TPOT 而非单窗口峰值。值得注意的是,DSpark 路径在相同硬件与负载下比 NEXTN 再降 1.9 倍平均 TPOT,说明模型架构与解码策略的配合仍有较大空间。不过,目前公开信息显示,这些优化是否已进入 SGLang 主线或开放给外部用户使用,博客中并未明确说明。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,DSpark 是否作为独立解码器在 SGLang 中开放,以及其对不同提示分布(而非固定随机负载)的接受长度表现如何,是值得观察的实用点。其次,Ling-3.0-flash 的优化经验能否迁移到其他混合注意力 MoE 模型,尤其是小米 MiMo 这类宣称超高速解码的竞品上,将决定这套优化方法的行业影响半径。最后,bf16 精度替换带来的数值稳定性在更长文本与更复杂推理任务下是否有退化,也需要后续基准验证。

来源:LMSYS:Blog(Chatbot Arena 团队)

celebrityanime
celebrityanime
文章: 19630

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注