云架构如何为AI时代重塑主存储

AI 大模型训练和推理对数据吞吐与海量存储提出新要求,传统紧耦合的主存储架构已无法满足。Seagate 云存储业务高级副总裁 Jason Feist 指出,云厂商正通过对象存储、元数据-数据分离、纠删码和智能数据分层等软件定义方法重塑主存储,使其成为 AI 基础设施的主动参与者。

一句话看懂:AI 大模型训练和推理对数据吞吐与海量存储提出新要求,传统紧耦合的主存储架构已无法满足。Seagate 云存储业务高级副总裁 Jason Feist 指出,云厂商正通过对象存储、元数据-数据分离、纠删码和智能数据分层等软件定义方法重塑主存储,使其成为 AI 基础设施的主动参与者。

事件核心:发生了什么

TechRadar 报道,随着 AI 模型参数量和企业训练数据的爆炸式增长,存储不再只是数据存放地,而是负责高效喂给算力、支持大规模数据集的活跃组件。传统主存储通常采用紧耦合的块/文件系统,紧邻计算部署;但在超大规模云环境下,管理数十亿文件带来巨大复杂性。云提供商转而将对象存储作为持久化的系统记录,用软件协调数据的存储、保护和跨分布式基础设施的访问。

Feist 总结了支撑 AI 规模化存储的四个架构原则:
1. 对象存储设计围绕顺序数据移动:不原地修改文件,而是写入新版本对象,天然适配大模型频繁的检查点和大规模数据流。
2. 元数据分离为软件层:存储设备只管容量效率,由专门软件层管理对象位置、命名空间和系统协调,提升可扩展性。
3. 弹性来自架构而非单设备高可靠:采用纠删码而非传统多副本,在千台设备故障场景下保持可用性并降低开销。
4. 智能数据分层保护性能:AI 工作负载常需要热数据快速访问,系统通过自动将数据放置在不同存储介质上平衡成本和延迟。

为什么重要

这一转变从根本上改变了企业对存储的采购和设计思路。AI 训练对数据吞吐的持续需求使存储成为模型迭代速度的瓶颈之一;同时,推理阶段需要快速检索大规模数据集,对象存储 + 软件定义的架构较传统 SAN/NAS 在成本灵活性和规模扩展上更具优势。对云平台而言,将元数据彻底从硬件中抽出也意味着存储层能独立升级,避免因设备锁定而阻碍创新。

此外,这一变化与 GPU 算力集群的部署直接联动——算力越强,喂给算力的数据管道必须越宽,存储架构的改造是不可或缺的配套投资。

对用户/开发者/创作者的影响

企业基础设施负责人:需要在评估 AI 方案时优先考察存储是否支持对象存储协议(如 S3)、元数据管理是否可独立扩展、是否内建纠删码和数据分层能力。传统块存储虽然延迟低,但难以应对百 TB 级数据集的频繁变更。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

AI 应用开发者:对象存储的 API 风格(写新对象、不原地修改)要求更改数据管道的设计模式,例如利用对象版本控制实现数据集快照,或将元数据查询交由专门的索引层处理。熟悉 S3 兼容 API 和对象存储 SDK 将成为基本功。

内容创作者/使用 AI 工具的用户:虽然不直接感知,但使用图像生成、视频理解等工具时,背后的存储架构决定了生成速度和是否能在高峰时段保持稳定。主流云服务商(AWS 的 S3、Azure Blob、GCP Cloud Storage)采用的就是对象存储架构,因此用户长期将受益于更低的存储成本和更快的模型加载。

值得关注的后续

1. 产品落地:Seagate 等存储厂商是否会推出专门针对 AI 训练场景的“热对象存储”产品,结合 HDD/SSD/磁盘不同介质做更精细的分层定价。
2. 性能对标:对象存储能否通过 NVMe over TCP 等新协议让延迟进一步接近传统块存储,从而让更多企业愿意将核心 AI 工作负载迁移到对象存储上。
3. 开源生态:开源对象存储方案(如 MinIO 和 Ceph)是否会在 AI 场景下获得更多企业部署,以及是否与主流 ML 框架(PyTorch、TensorFlow)的数据加载器有更深度集成。

来源:TechRadar

celebrityanime
celebrityanime
文章: 15780

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注