NVIDIA NVLink:AI工厂的扩展网络

NVIDIA 发布了第六代 NVLink 互连技术,定位为“AI 工厂”专用的扩展网络(Scale-up Network),旨在解决大模型训练和推理中 GPU 间高带宽、低延迟通信瓶颈,实测可提升混合专家模型(MoE)推理吞吐量至 2.3 倍于普通以太网。

NVIDIA NVLink:AI工厂的扩展网络

一句话看懂:NVIDIA 发布了第六代 NVLink 互连技术,定位为“AI 工厂”专用的扩展网络(Scale-up Network),旨在解决大模型训练和推理中 GPU 间高带宽、低延迟通信瓶颈,实测可提升混合专家模型(MoE)推理吞吐量至 2.3 倍于普通以太网。

事件核心:发生了什么

NVIDIA 在其博客中系统阐述了 NVLink 作为 AI 工厂扩展网络(Scale-up Network)的设计逻辑。当前 AI 工作负载已从单一 GPU 计算转向数千 GPU 协同,尤其是万亿参数级模型、MoE 架构和长上下文推理场景,要求 GPU 之间的通信具备极高的全互联带宽和极低延迟。第六代 NVLink 与 NVLink 6 Switch 是为此场景定制,支持 SHARP 网络内计算来卸载集合通信操作,并内置了机架级的故障恢复机制,以保障 AI 工厂的高可用运行。

NVIDIA 团队在模拟环境中测试了 DeepSeek-R1、Qwen 235B 以及一个 2T 参数的模拟 LLM,结果显示,在 72 个加速器规模的扩展域中,第六代 NVLink 相比主流商用以太网,解码吞吐量最高提升 2.3 倍。这一对比直接强调了专用扩展网络在 MoE 模型推理中的巨大价值。

为什么重要

随着 AI 模型规模持续膨胀,尤其是 MoE 架构的流行(如 DeepSeek-R1),GPU 间的通信模式已从少数节点的同步变为大批量、高并发的“全对全”通信。传统数据中心使用的“扩展网络”(Scale-out Network,如 InfiniBand 或 Spectrum-X 以太网)负责连接不同机架间的服务器,而“扩展网络”(Scale-up Network)则负责单个 GPU 域内的极速互连。两者缺一不可,但差异巨大。

NVIDIA 明确提出,扩展网络决定了 AI 工厂的单位功耗、单位成本、单位面积能产出多少有效 token,直接影响了运营商的 ROI。这意味着,未来 AI 基础设施的竞争力不再仅仅由单卡算力(FLOPS)决定,而是由整个加速器域协同效率决定。NVIDIA 通过极致协同设计(从芯片到系统再到软件)将 NVLink 纳入年度 AI 基础设施路线图,意图将其打造成 AI 工厂的经济性关键变量。

对用户/开发者/创作者的影响

对于模型开发者与推理服务提供商而言,NVLink 的优势直接转化为更低的每 token 推理成本和更短的时间延迟。特别是使用 MoE 模型(如 Mixtral、DeepSeek-R1)进行大规模推理时,如果选用配备 NVLink 的集群,相比基于普通以太网的集群,可以获得 2 倍以上的有效吞吐量提升,这在实际业务中意味着相同的硬件投入可以服务更多用户请求。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于个人创作者或小型开发团队,虽然直接接触 NVLink 的机会有限,但这项技术将推动云服务商提供更具性价比的 GPU 实例。未来在云端使用 MoE 模型的推理服务时,应当关注云厂商是否采用了 NVLink 连接的多卡集群,这将影响模型响应速度和使用成本。

值得关注的后续

第一,第六代 NVLink 的具体商用时间表和配套硬件(如搭载该互连的 GPU 和交换机)尚未公布,NVIDIA 仅将其表述为“年度 AI 基础设施路线图”的一部分,需要关注后续 GTC 大会的硬件发布节奏。第二,竞争对手如 AMD 的 Infinity Fabric 和 Broadcom 的 Jericho 系列也在迭代,NVLink 是否能在性能代差和开放生态上持续领先,将影响数据中心采购决策。第三,目前测试数据来自 NVIDIA 模拟环境,实际部署中是否存在散热、功耗或成本的限制,需要等待第三方独立测试验证。

来源:NVIDIA Generative AI Blog

celebrityanime
celebrityanime
文章: 14740

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注