AI数据中心撞上电网与散热墙:GPU机柜功耗破100kW,互连瓶颈显现

TechRadar 指出,AI 数据中心正同时受制于电网接入排队、GPU 机柜散热极限和互连带宽瓶颈,这些物理约束开始拖慢 AI 算力扩张。它值得关注,因为算力供给不再只取决于芯片产能。

一句话看懂:TechRadar 指出,AI 数据中心正同时受制于电网接入排队、GPU 机柜散热极限和互连带宽瓶颈,这些物理约束开始拖慢 AI 算力扩张。它值得关注,因为算力供给不再只取决于芯片产能。

事件核心:发生了什么

据 TechRadar 报道,AI 数据中心正接近电网容量和散热能力的物理上限。电网被拉紧,新建 AI 数据中心接入等待时间变长;现代 GPU 机柜功耗已超过 50 至 100 kW,传统风冷和常规液冷难以支撑这种密度。

散热方面,标准冷却系统维持 65 至 85 度运行,90 至 100 度会触发 GPU 降频以防损坏。风冷原本只适应 30 至 40 kW 的机柜密度,而 100 kW 以上正在成为常态,仅靠风冷需要“飓风级”气流,不现实。互连方面,电铜缆在超过两米后信号衰减,带宽需求每翻倍可用距离减半,密集铜互连还会产生电磁干扰,增加均衡功耗和电路板电阻损耗。

行业正在尝试直接芯片冷板、两相浸没式液冷和闭路液冷。报道称两相浸没式液冷可降低最多 40% 的冷却能耗;微软已在较新数据中心部署闭路液冷系统,但成本高、规模化推广仍需时间。

为什么重要

这些瓶颈说明,AI 算力扩张的约束正从 GPU 供应转向电力、散热和互连等基础设施。如果电网接入排队和散热能力跟不上,训练集群的部署节奏、单位算力成本和数据中心选址都会受影响。对云厂商和大型 AI 公司而言,谁先解决物理层问题,谁就更可能稳定地提供大规模训练与推理服务。

对用户/开发者/创作者的影响

短期内,普通用户和开发者可能感受不到直接变化,但中长期看,如果算力供给受物理设施制约,云端 GPU 租赁价格和可用性可能承压,大模型 API 的配额和延迟也可能波动。使用图像生成、视频生成等推理密集型应用的创作者,尤其依赖稳定的云端算力,基础设施瓶颈会间接影响服务体验。企业采购方在评估 AI 云服务时,也需要把供应商的电力与散热部署能力纳入考量,而不只是看 GPU 型号和数量。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是微软等厂商的闭路液冷方案能否在更多数据中心规模化落地,以及成本是否下降。二是两相浸没式液冷、直接芯片冷板的实际部署速度和长期可靠性。三是电铜互连瓶颈是否加速光互连在 GPU 集群中的替代,以及电网接入排队是否促使 AI 数据中心向电力更充裕的地区转移。

来源:TechRadar

celebrityanime
celebrityanime
文章: 28798

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注