一句话看懂:SemiAnalysis 援引的测试数据显示,NVIDIA 下一代 Vera Rubin NVL72 平台在 1.6T 参数 DeepSeek 模型上,每兆瓦 token 吞吐量最高达到 Blackwell 的 7 倍,明显高于黄仁勋此前对 1T–3T 级大模型给出的 3 倍说法。
事件核心:发生了什么
据 Techmeme 收录、SemiAnalysis 作者 Bryan Shan 的信息,Vera Rubin NVL72 的推理测试选取了 1.6T 参数的 DeepSeek 模型作为负载。结果显示,其单位功耗的 token 吞吐量相比 Blackwell 最高提升约 7 倍。这一数字高于 NVIDIA 掌门人黄仁勋此前针对 1T–3T 参数区间大模型所声称的 3 倍能效提升。需要说明的是,目前公开信息仅为测试结论的转述,具体的测试配置、batch size、精度设置、是否含稀疏化或量化等条件尚未完整披露。
为什么重要
如果该数据在更透明的条件下成立,意味着 AI 推理的竞争焦点正从“单卡算力”转向“每瓦产出”。对数据中心而言,电力与散热是真实约束,token/MW 直接决定单机柜能承载多少并发请求,也影响单位推理成本。7 倍与 3 倍的差距,可能来自新架构在显存带宽、互连或低精度推理上的改进,而不只是制程红利。这也会给云厂商的采购决策和大模型 API 定价带来新的参考坐标,同时让 AMD、谷歌 TPU 以及自研推理芯片面临更直接的能效对比压力。
对用户/开发者/创作者的影响
对开发者来说,推理能效提升通常会先体现在云服务侧:同等算力下可支撑更高并发,长上下文和 Agent 类应用的调用成本有望下行,但降价是否传导到 API 价格仍取决于云厂商策略。对企业采购而言,评估 GPU 集群时不能只看 FLOPS,token/MW 和实际吞吐会更关键。对内容创作者和 AI 应用团队,更低的推理成本意味着图像生成、视频处理、批量文本任务等高频调用场景的预算压力可能缓解,但短期内模型能力本身不会因此跳变。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 SemiAnalysis 是否公布完整测试条件,尤其是精度、并发和功耗口径,这决定 7 倍能否被复现。二是 NVIDIA 官方是否给出对应的能效白皮书或基准数据,与黄仁勋的 3 倍说法如何对齐。三是 Rubin 平台的实际交付时间和云厂商上线节奏,以及主流 API 价格是否随之调整。
来源:Techmeme


