一句话看懂:NVIDIA 在开发者博客中系统解释了多模态模型推理的新优化方案 EPD 分离(编码-预填充-解码),并给出实测数据:在图像密集、输出较短、量化 MoE 模型场景下,首字延迟(TTFT)最高可提升 5 倍,端到端响应时间最高提升 7 倍。
事件核心:发生了什么
NVIDIA 基于开源推理框架 Dynamo,提出并验证了 EPD 分离(Encode-Prefill-Decode Disaggregation)方案。传统多模态推理中,视觉编码(ViT 前向)、大模型预填充和解码共享同一个计算 GPU 和调度域。当请求包含大量图像或视频时,视觉编码可能耗时数百毫秒,会阻塞自身预填充,也会拖慢并发的纯文本请求。
EPD 将视觉编码阶段独立为专用 encoder worker,只负责生成视觉嵌入向量,再通过 NVIDIA NIXL 传输库把 embeddings 传给 PD worker 完成 LLM 推理。NVIDIA 给出三种部署拓扑:聚合式、同机共置(colocated)和跨机分离(disaggregated)。其中同机共置通常适合同构集群,跨机分离适合用低成本 GPU 承担编码、主力 GPU 承担 LLM 推理的异构集群,例如测试中用两张 RTX 6000D 跑编码、四张 GB200 跑 PD。原文同时给出了不建议使用 EPD 的场景。
为什么重要
多模态模型正从演示走向生产,图像理解、视频问答、文档解析等请求占比持续上升,推理成本结构随之变化。EPD 分离本质上是把“轻量但耗时不稳定”的视觉编码从 LLM 推理链路中拆出来,让三个阶段能独立批处理、独立扩缩容,从而提高 GPU 利用率和同 SLO 下的有效吞吐。对云厂商和推理服务商来说,这意味着可以用异构算力分层承接不同负载,而不是把所有工作压在同级 GPU 上。这也是 Dynamo 作为开源推理框架在分布式服务能力上的一次明确补强。
对用户/开发者/创作者的影响
对做多模态 API 的开发者,EPD 提供了一个可调优的部署选项:当请求以多图、视频、长文档截图为主,且输出较短时,TTFT 改善最明显。对使用量化 MoE 模型的团队,这一收益更容易兑现。创作者端体感是图像类问答和生成前处理等待时间缩短,但这不是模型能力升级,只是服务侧优化。企业采购算力时,可以关注是否支持把编码任务放到较低成本 GPU 层,从而降低单位推理成本。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Dynamo 中 EPD 的实际落地成熟度,包括 NIXL 传输在跨机场景下的稳定性和额外开销;二是同机共置与跨机分离在不同硬件组合下的性价比对比是否会有更完整的公开基准;三是竞品推理框架是否会跟进类似的编码分离设计。目前公开信息显示,EPD 并非普适加速手段,编码工作量不够大时,协调与传输开销可能抵消收益。


