FluidPD 提出 P/D 解耦就地弹性方案,Azure 生产负载 SLO 最多提升 94.6 个百分点

arXiv 新论文 FluidPD 提出一种面向 SLO 的预填充-解码解耦服务方案,通过让预填充与解码任务动态借用资源、就地换角色,在 Azure 生产负载上把 SLO 达成率较静态 SGLang 最多提升 94.6 个百分点。它值得关注,因为它试图解决大模型推理中“忙闲不均却无法临时调配”的老问题。

一句话看懂:arXiv 新论文 FluidPD 提出一种面向 SLO 的预填充-解码解耦服务方案,通过让预填充与解码任务动态借用资源、就地换角色,在 Azure 生产负载上把 SLO 达成率较静态 SGLang 最多提升 94.6 个百分点。它值得关注,因为它试图解决大模型推理中“忙闲不均却无法临时调配”的老问题。

事件核心:发生了什么

根据 arXiv cs.AI 于 2026 年 10 月 7 日发布的新论文摘要,FluidPD 瞄准的是当前 LLM 推理服务中常见的预填充-解码解耦架构。这种架构把两个执行特征和 SLO 目标不同的阶段拆开,但现有系统通常采用固定的预填充/解码 worker 比例,再靠请求路由分发流量。问题在于,真实业务负载既有短时突发,也有持续时间较长的需求比例漂移,固定配比很容易在某个时刻失配,导致延迟 SLO 被打破,即便集群里还有空闲算力。

论文提出两个机制:FluidToken 在解码侧出现余量时,把有界的预填充计算临时卸载过去,用于应对短时失衡;FluidRole 则针对持续失衡,让正在运行的 worker 就地切换预填充和解码角色,避免重新加载模型或重启推理引擎。两者都由轻量压力指标驱动,在 SLO 违规发生前暴露两侧资源压力。摘要给出的结果是,在 Azure 生产 trace 负载上,FluidPD 相对静态 SGLang 最多提升 94.6 个百分点。需要强调,以上均来自论文摘要,目前公开信息显示尚未核验全文实验与工程部署细节。

为什么重要

大模型推理成本高、延迟敏感,预填充和解码的资源配比一直是服务端优化重点。传统自动扩缩容虽然能加机器,但反应慢、需要备用 GPU,对秒级或分钟级的阶段失衡帮助有限。FluidPD 的思路不是在集群外再加容量,而是在既有 worker 之间做就地弹性,这直接关系到 GPU 利用率和推理服务的单位经济性。如果该机制在后续复现中成立,它会推动推理框架从“静态配比+路由”进一步转向“按压力动态调配角色”,对开源推理栈和云厂商的托管推理服务都有参考价值。

对用户/开发者/创作者的影响

对普通用户和内容创作者而言,这类优化不会直接改变模型能力,但可能影响 AI 应用的响应速度和高峰期的可用性。对开发者来说,值得关注的是 FluidPD 是否会进入开源推理引擎或云 API 的调度层:如果落地,部署大模型时可能不再需要为预填充和解码分别预留固定比例的 GPU,运维复杂度有机会下降。对企业采购和算力规划者,这项研究提示评估推理方案时,不能只看峰值吞吐,还要看负载比例漂移下的 SLO 稳定性和资源利用率。目前它还只是论文方案,不构成可直接采购的产品功能。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,观察是否公开代码或与 SGLang、vLLM 等推理框架集成,这决定开发者能否实际验证。第二,关注 94.6 个百分点提升所对应的具体负载、SLO 阈值和基线的可复现性,单篇摘要不足以代表普遍表现。第三,留意云厂商和推理服务商是否跟进“就地角色切换”思路,以及它会不会改变 GPU 实例的选型与计费方式。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28181

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注