SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启

SGLang 团队联合蚂蚁集团推出了 Weight Cache Daemon,通过 CUDA IPC 让模型权重常驻 GPU 显存,将超大模型重启时的权重加载时间从约 495 秒压缩到 0.63 秒,为生产环境大模型服务的热恢复和故障切换提供了新方案。

一句话看懂:SGLang 团队联合蚂蚁集团推出了 Weight Cache Daemon,通过 CUDA IPC 让模型权重常驻 GPU 显存,将超大模型重启时的权重加载时间从约 495 秒压缩到 0.63 秒,为生产环境大模型服务的热恢复和故障切换提供了新方案。

事件核心:发生了什么

LMSYS(Chatbot Arena 团队)博客于 2026 年 8 月 21 日发布了 SGLang 的 Weight Cache Daemon 方案。该方案针对大模型冷启动耗时过长的问题,设计了一个常驻 GPU 的守护进程,在引擎重启后通过 CUDA IPC 零拷贝映射直接复用已加载并完成量化、TP 切分的模型权重,绕开磁盘 I/O 和反序列化流程。

在 Ling-2.6-1T FP8 模型的测试中,权重加载时间从 495 秒降至 0.63 秒,提速约 785 倍;引擎整体启动时间从 8.8 分钟降至 0.528 分钟,降幅达 93.9%。该功能支持单节点与多节点模式,并允许多个引擎实例共享同一 GPU 上的 IPC 权重句柄,减少重复磁盘读取和量化转换开销。

为什么重要

当前模型规模正快速膨胀,Qwen3-235B、Ling-2.6-1T 乃至 2.8T 参数的 Kimi K3 已相继出现。权重加载占用了引擎启动时间的 90% 以上,是大规模推理部署中故障恢复、滚动更新和配置变更的主要瓶颈。传统主动-备用的高可用方案需要为备用实例预留整套 GPU,硬件成本翻倍。

Weight Cache Daemon 的意义在于把“重新加载”变成“内存共享”。备援引擎不需要完整显存副本,通过零拷贝即可在 1 秒内完成切换,这直接降低了大规模推理集群的冗余成本和恢复时间窗口,也让多实例共享同一组权重成为可能,对推理资源利用率有明显改善。

对用户/开发者/创作者的影响

对使用 SGLang 部署超大模型的开发者或企业而言,该功能可显著缩短服务中断时间。遇到配置调整、引擎崩溃或版本回滚时,原本需要等待近 9 分钟才能恢复服务的场景可缩短至半分钟以内,故障期间的请求失败率和 P99 延迟尖峰也会相应减少。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对模型服务运维团队,多实例权重共享意味着同一 GPU 上可运行多个引擎实例而不必重复加载权重,降低了显存和磁盘带宽的占用。目前公开信息显示,该功能是 SGLang Fast Engine Recovery Framework 的第一阶段,后续目标是实现小于 10 秒的冷启动和小于 1 秒的温备切换,生产环境可用性有望进一步提升。

值得关注的后续

一是该功能是否会被更多生产级推理框架采纳,例如 vLLM 或 TensorRT-LLM 是否跟进类似设计;二是配置校验机制在实际部署中的安全性表现——守护进程持有权重期间如何应对引擎与缓存配置不匹配的情况,仍是关键细节;三是多节点模式下,跨机 CUDA IPC 的扩展性和稳定性是否维持同等水准,有待更大规模集群验证。

来源:LMSYS:Blog(Chatbot Arena 团队)

celebrityanime
celebrityanime
文章: 19632

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注