这项AI SSD技术让8张RTX 5090在推理时性能相当于46块GPU

GenStorAIGE 在 WAIC 2026 上发布了 AI90 推理加速平台,通过将 SSD 直接纳入显存层级,让 8 块 RTX 5090 在大型语言模型推理中的表现等效于 46 块 GPU 的集群。这一技术突破了传统 GPU HBM 的容量瓶颈,为大规模长上下文推理提供了一条新的低成本路径。

一句话看懂:GenStorAIGE 在 WAIC 2026 上发布了 AI90 推理加速平台,通过将 SSD 直接纳入显存层级,让 8 块 RTX 5090 在大型语言模型推理中的表现等效于 46 块 GPU 的集群。这一技术突破了传统 GPU HBM 的容量瓶颈,为大规模长上下文推理提供了一条新的低成本路径。

事件核心:发生了什么

GenStorAIGE 推出的 AI90 平台,核心是构建了一个 HBM、系统 DRAM 和 SSD 组成的三级内存架构。它将大语言模型推理中关键的 KV Cache 数据透明地卸载到 PCIe Gen5 SSD 上,从而大幅降低 GPU 显存压力。该平台搭配了专为持续写入场景设计的 PT200Z 固态硬盘,采用 pSLC NAND 闪存和 PCIe Gen5 x4 接口,顺序读取速度达到 14.8 GB/s,写入延迟低至 10 微秒。

根据 GenStorAIGE 的数据,AI90 架构能实现首 Token 延迟降低 50 倍(从数秒降至亚秒级),吞吐量提升 5.1 倍,GPU 内存占用减少约 39%。在 8 块 RTX 5090 显卡的系统上,结合智能的点对点 GPU 通信,能将推理速度提升 5.8 倍,使其等效于 46 块 GPU 的推理集群性能。同时,该架构原生支持超过 128,000 Token 的上下文窗口。

为什么重要

随着大模型参数量和上下文窗口的不断增长,GPU HBM 容量已成为推理成本的主要瓶颈。目前主流的扩展方式依赖更大容量的 HBM(如 HBM3e)或更多 GPU,但成本极高。

AI90 的思路是将极高性能的 SSD 作为内存层级的一部分,而非仅仅是存储设备。这种方式在工程上提供了一种更经济的算力扩展方案,尤其适合需要处理长文档、多轮对话或检索增强生成的企业级推理负载。它直接挑战了“更大显存 = 更多 GPU”的固定搭配,可能影响未来 AI 推理服务器和云基础设施的架构设计。

对用户/开发者/创作者的影响

对于 AI 应用开发者:该技术意味着在有限的硬件预算下,可以部署上下文更长、推理质量更高的模型。开发者无需等待 GPU 更新换代,就能通过集成此类 SSD 缓存方案来扩展单节点的推理能力。但需注意,性能提升依赖于 SSD 的持续写入能力,对存储寿命和可靠性要求较高。

对于企业采购与硬件规划者:在 AI 服务器选型时,存储层的性能权重将显著提升。过去以 GPU 数量为核心的性价比模型可能面临调整,评估系统需要加入存储架构对推理延迟和吞吐量的影响。

对于普通用户:作为最终服务的使用者,可能感受到 AI 对话响应速度更快、模型能记忆更长对话历史,且服务提供商在用户端显示的价格可能因硬件成本降低而更具竞争力。

值得关注的后续

首先,GenStorAIGE 的所有性能数据均来自内部测试,真实性有待第三方独立基准验证。其表现是否会因不同的模型架构、批处理大小或数据集而产生差异,是判断技术落地价值的关键。

其次,这种“以 SSD 换性能”的方案,其长期耐用性在持续的高负载写入环境下是否经过充分验证,直接影响企业采购决策。

最后,这一定位可能引发 NVIDIA、AMD 等 GPU 厂商在系统内存管理(如借助 NVLink 或 CXL 的池化内存)技术路线上的新竞争或合作,值得行业关注。

来源:TechRadar

celebrityanime
celebrityanime
文章: 15160

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注