Meta enlists tiny Korean startup to build ‘one-chip-like datacenter’ — CXL architecture introduced by Facebook’s parent company and Panmnesia can handle almost 1000 AI GPUs per domain

Meta 正与韩国初创公司 Panmnesia 合作,用 CXL 技术把约 960 块 AI 加速器连进同一个一致性域,让多机架算力像一颗芯片一样协同工作,目标直指大规模 AI 训练中跨服务器通信延迟这个老难题。

一句话看懂:Meta 正与韩国初创公司 Panmnesia 合作,用 CXL 技术把约 960 块 AI 加速器连进同一个一致性域,让多机架算力像一颗芯片一样协同工作,目标直指大规模 AI 训练中跨服务器通信延迟这个老难题。

事件核心:发生了什么

据 TechRadar 报道,Meta 与韩国初创公司 Panmnesia 合作设计了一套基于 CXL(Compute Express Link)的 AI 数据中心架构。与英伟达 GB200 NVL72 中一颗 CPU 通过 NVLink-C2C 直接协调两块加速器不同,Panmnesia 的方案让一颗 CPU 协调最多 16 块加速器,提升约 8 倍;再由约 60 个这样的分组构成一个一致性域,容纳约 960 块 AI 加速器。整个系统由高扇出交换机、链路加速单元和 fabric 控制器组成,并按 tray、pod、fabric 分层组织,借鉴了芯片内部功能块的布局思路。目前公开信息显示,其 fabric 控制器和链路加速单元已完成硅验证,交换机也已流片。

为什么重要

AI 训练规模上去之后,真正的瓶颈往往不是单卡算力,而是跨机架通信。传统以太网或 InfiniBand 需要包处理和软件协调,负载铺开越大,延迟抖动越明显,一块卡掉队就可能拖慢整批任务。CXL 提供共享一致性机制,让 CPU、加速器和内存处于同一资源环境。按这套设计,跨机架访问延迟可从微秒级降到几百纳秒,约一个数量级;设备故障时还能单独更换,而不必整台服务器下线。这对超大规模训练集群的资源利用率有直接意义。

对用户/开发者/创作者的影响

短期看,普通用户和大模型 API 调用者不会直接感知变化,这类底层架构通常先服务于 Meta 自家训练集群。对开发者和企业采购方而言,它提示了一个判断维度:未来选算力不只看 GPU 数量和单价,还要看互联拓扑与故障隔离能力,因为后者决定集群实际有效吞吐。做推理服务或多模态训练的团队,也可关注 CXL 内存池化是否降低显存与主机内存的调度成本——目前仍属早期。物理限制仍在:电信号 CXL 在 128 GT/s、两个 retimer 下约 7 米,更长距离需转向光互连,Panmnesia 称已完成硬件概念验证。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是这套架构是否从设计验证走向 Meta 生产集群部署,以及实际训练任务中的延迟与利用率数据;二是英伟达 NVLink 生态与 AMD、英特尔等 CXL 阵营的竞合走向,尤其是交换机与 fabric 控制器能否形成开放供应链;三是光学 CXL 的商用进度与成本,这决定它能否跨出单机房。

来源:TechRadar

celebrityanime
celebrityanime
文章: 23276

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注