使用 NVIDIA Dynamo-Triton 部署 HSTU 生成式推荐系统

NVIDIA 通过 recsys-examples 仓库,把 HSTU 生成式推荐模型的训练到上线链路接到了 Dynamo-Triton 上,并借助 PyTorch AOTI 和 FlexKV 缓存把重复计算压下来。在 RTX PRO 6000 Blackwell 工作站 GPU 上,八层 HSTU 模型实测…

一句话看懂:NVIDIA 通过 recsys-examples 仓库,把 HSTU 生成式推荐模型的训练到上线链路接到了 Dynamo-Triton 上,并借助 PyTorch AOTI 和 FlexKV 缓存把重复计算压下来。在 RTX PRO 6000 Blackwell 工作站 GPU 上,八层 HSTU 模型实测最高降低延迟 5.93 倍。

事件核心:发生了什么

NVIDIA 在开发者博客中公布了一套端到端的 HSTU 生成式推荐推理方案。所谓 HSTU(Hierarchical Sequential Transduction Unit),是把推荐从“召回—排序—预测”这类分阶段流水线,改写为对用户行为序列的建模:用户上下文、物品、动作和候选物品都变成 token,模型直接预测或打分下一个相关物品。

这套方案整合了多项工程组件:PyTorch Ahead-of-Time Inductor 编译负责把模型提前编译成部署产物,FlexKV 提供 GPU 与主机两级 KV 缓存,原生 C++ 校验用于验证部署产物,NV embedding cache 处理大嵌入表,最终由 Dynamo-Triton(原 Triton Inference Server)对外提供服务。官方数据显示,在动态 batch size 8 和 100% GPU KV 缓存命中率下,对比未启用 KV 缓存的同配置 AOTI,三层 HSTU 模型最佳加速 4.47 倍,八层模型 5.93 倍。

为什么重要

生成式推荐正在成为大规模个性化的新路线,但真正卡住落地的是推理,而不是训练。用户历史长、物品目录频繁变化、嵌入表巨大、请求之间高度重复,导致每次请求重算完整 KV 状态非常浪费。NVIDIA 这次的价值在于把“KV 缓存 + 编译优化 + 标准推理服务器”组合成可复制的部署路径,而不是只给一个模型结构。

对行业来说,Dynamo-Triton 本来就是生产环境常见的推理入口,HSTU 接入后,团队不必为生成式推荐单独重写一套运行时。相比自研推理栈,这降低了从 PyTorch 开发到线上服务的迁移成本,也会推动更多推荐团队评估“序列建模替代传统多阶段模型”的可行性。

对用户/开发者/创作者的影响

对推荐系统开发者,最直接的变化是可以在现有 Triton 部署流程里接入 HSTU,用 AOTI 编译、C++ 校验和 FlexKV 缓存来管理长序列推理。GPU 缓存空间不足时,系统按 LRU 类策略淘汰旧用户,主机侧作为第二级缓存,这对“老用户历史稳定、只追加少量新行为”的场景尤其合适。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

从企业采购和算力角度看,这类优化能把延迟压力从“堆更多 GPU”部分转移到内存层级和缓存策略上。对内容平台和电商来说,如果推荐延迟下降且质量保持,意味着可以在同一批硬件上支撑更复杂的排序模型,或把节省的算力留给特征与多任务目标。

值得关注的后续

一是这套流程在真实业务流量下的表现,尤其是缓存命中率不稳定、用户行为突增时的延迟波动;二是除 NVIDIA 自家示例仓库外,社区是否会把它封装成更通用的推理框架插件;三是 FlexKV 与主机缓存的组合在不同 GPU 型号上的性价比,是否会让中小团队也有动力迁移到序列式推荐架构。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 26594

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注