借助 NVIDIA Dynamo-Triton 中的 TensorRT 多设备集成,简化跨多 GPU 的模型服务

NVIDIA 在 TensorRT 11.0 中推出多设备推理能力,并已在 Dynamo-Triton 26.07 中落地:单个 TensorRT 网络可跨多块 GPU 执行,应用只需调用一个 gRPC 模型端点,无需自己协调各 GPU 进程。

一句话看懂:NVIDIA 在 TensorRT 11.0 中推出多设备推理能力,并已在 Dynamo-Triton 26.07 中落地:单个 TensorRT 网络可跨多块 GPU 执行,应用只需调用一个 gRPC 模型端点,无需自己协调各 GPU 进程。

事件核心:发生了什么

生成式 AI 的算力与显存需求正超出单块 GPU 的承载范围。NVIDIA 推出 TensorRT 多设备推理(multi-device inference),让同一套 TensorRT 网络借助 NCCL 分布式集合通信在多块 GPU 上运行,同时保留 TensorRT 原有的推理优化。该能力自 TensorRT 11.0 起获得完整支持。

在新版 Dynamo-Triton(原 Triton Inference Server)26.07 中,TensorRT 后端正式开放这一路径。一个 KIND_MODEL 实例可以独占多块 GPU,为每个 rank 创建独立的 TensorRT 执行上下文、CUDA stream 和 NCCL 通信器,并在每次请求时统一启动所有 rank。官方用 Cosmos 3 Nano 视频生成做了示例:36 层去噪 transformer 占单 GPU 生成耗时的 93.4%,通过 Ulysses 上下文并行把 44160 个视频 token 分配到最多 8 块 GPU 上,客户端每步只需发起两次顺序的 Triton 调用。

为什么重要

此前多 GPU 加速的瓶颈往往不在算子本身,而在工程集成:rank 分配、通信器生命周期、并行配置通常要写进客户端或上层框架。这次集成把分布式复杂度收进服务端,把多 GPU 引擎打包成一个带版本号的 Triton 模型,对外仍是单一 gRPC 端点。对部署生成式 AI 的团队来说,这意味着可以用更多 GPU 资源换取更低的单次请求延迟,而应用接口和周边工作流保持不变。工艺上,Ulysses 是通过标准注意力周围插入 TensorRT 分布式集合通信层实现的,并非使用单独的多设备注意力算子;每个 CP 计划包含 2 个 reduce-scatter、36 层各 3 个 all-to-all、以及 1 个 all-gather —— 即 2 + 108 + 1 的拓扑。

对用户/开发者/创作者的影响

开发者侧:不必再在客户端维护 rank 和通信器代码,多 GPU 推理可以像调用普通模型一样通过 gRPC 接入,配置项集中在 enable_multi_devicemulti_device_gpus 等参数上,部署形态更接近常规服务。创作者侧:视频生成这类长序列负载的端到端出图时间有望缩短,审阅和迭代周期相应加快,但代价是占用更多 GPU。企业采购侧:值得评估的是单位延迟的 GPU 成本,目前公开信息显示官方尚未给出跨规模的价格或吞吐对比结论。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一,多设备推理是否从视频生成扩展到 LLM 推理、图像生成等更常见负载;二,TensorRT 11.0 与 Dynamo-Triton 26.07 的实际部署门槛、支持的 GPU 型号与通信拓扑限制;三,竞品推理栈(如 vLLM、SGLang 等)是否会跟进类似的单端点多 GPU 抽象。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 24870

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注