HBM 不够用了,AI SSD 迎来爆发前夜

大模型推理正在同时撞上显存容量和 I/O 两堵墙,SSD 不再只是“模型文件仓库”,而是开始进入 KV Cache 卸载、MoE 专家权重调度等实时推理链路。英韧、华为、群联、江波龙、联芸—寅谱等厂商已拿出不同路线,AI SSD 正成为算力基础设施竞争的新焦点。

一句话看懂:大模型推理正在同时撞上显存容量和 I/O 两堵墙,SSD 不再只是“模型文件仓库”,而是开始进入 KV Cache 卸载、MoE 专家权重调度等实时推理链路。英韧、华为、群联、江波龙、联芸—寅谱等厂商已拿出不同路线,AI SSD 正成为算力基础设施竞争的新焦点。

事件核心:发生了什么

传统上,SSD 只是用来存放模型文件,推理时由 HBM、DRAM 承接计算数据。但随着长上下文、多轮对话和 MoE 模型普及,KV Cache 和专家权重快速膨胀,HBM 装不下、数据搬不动,推理系统开始把 SSD 纳入实时数据路径。月之暗面的 Mooncake 架构已将 CPU、DRAM 与 SSD 组织为分布式缓存;英伟达也在 Vera Rubin 平台中加入面向 KV Cache 优化的 CMX 闪存层级。

不过传统 SSD 其实不适合这份工作:NAND 的擦写机制、FTL 垃圾回收会带来延迟抖动,LBA 地址排布也不理解模型层、专家和 KV 块的语义顺序。为此,市场出现两类“AI SSD”:一类是强化型企业级产品,如英韧洞庭 N3X,时延可降至约三分之一,DWPD 比传统 TLC SSD 提高 17—33 倍;华为 OceanDisk 系列则按极致性能(EX 560)、均衡推理(SP 560)和超大容量(LC 560,单盘最高 245TB)拆分产品线。

另一类更进一步,试图让 SSD 直接参与运行时调度:群联 aiDAPTIV 将模型权重在 VRAM 与 SSD 间流式传输,缓存 SSD 耐久性最高达 100 DWPD;江波龙推出 5nm WM8500 SPU 主控和 iSA 软件框架,做压缩、冷热识别与预取;联芸与寅谱则从 MoE 专家、KV Cache 和数值精度三个维度做跨 middleware、固件与控制器的协同调度,并强调不修改模型文件、兼容主流推理框架。

为什么重要

这标志着 AI 存储竞争从“单盘快不快”升级为“系统能不能按时喂数据”。HBM 昂贵且产能有限,靠堆显存解决不了长上下文和 MoE 推理的成本与规模问题。把温冷数据从 DRAM/VRAM 下沉到高性能闪存,能在不大幅增加 GPU 的情况下扩大可运行模型规模,直接改变算力中心的 TCO 结构。

同时,竞争壁垒正在变化:后来者光做一块高 IOPS SSD 已经不够,需要同时掌握 NAND 控制、推理调度软件、模型生态适配和整机验证能力。目前公开信息显示,群联、江波龙、联芸—寅谱的路线尚未收敛,但都在从概念走向产品验证——寅谱—联芸已覆盖 AI PC、Mini 工作站、边缘计算和企业级节点多种形态。

对用户/开发者/创作者的影响

对普通用户和创作者来说,这类技术最直接的影响是本地设备的模型上限会提高:中端显卡甚至 AI PC 也可能通过“VRAM+AI SSD”分层运行更大参数量或更长上下文的模型,私有化部署和本地微调的门槛随之下降。对开发者而言,若这些方案宣称的“不修改模型、兼容主流推理框架”真正落地,API 调用和微调工作流不必重写;但需要关注中间件在不同 CPU、GPU、NPU 平台上的实际兼容性。对企业采购者,AI SSD 让存储部门重新进入算力决策的核心,采购时不能只看 IOPS,还要评估其与推理引擎、模型负载的协同效果。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,这些产品能否在真实推理负载中持续稳定运行,尤其是低队列深度下的延迟和垃圾回收对长任务的影响,目前公开数据仍偏重峰值指标。第二,群联、江波龙、联芸—寅谱谁先形成完整生态(主控+固件+中间件+整机合作),将决定技术路线走向。第三,价格是个关键变量——当 AI SSD 的单位成本优势足以抵消部署复杂度,它才会真正进入主流算力采购清单。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 18322

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注