一句话看懂:存储供应商 OpenLake 在 MLPerf Storage v3.0 基准测试的 Llama 3.1 8B 检查点写入场景中跑出最高读写带宽,用 6.72 GiB/s 写入和 11.55 GiB/s 读出的成绩,回应了大模型训练中“GPU 等存储”的痛点。
事件核心:发生了什么
MLCommons 于 2025 年 9 月 1 日公布了 MLPerf Storage v3.0 结果。OpenLake 凭借其 Infinity Core I/O 引擎,在 Llama 3.1 8B 检查点基准测试的 Closed 组别中,于单客户端节点、单数据并行实例的 S3 接口配置下,取得了最高的读取和写入带宽。该测试模拟了 8 个进程通过 16 个文件反复写入并读取检查点的真实压力,OpenLake 的提交系统通过 400 Gb/s InfiniBand 网络连接 NVMe 后端的网关设备完成。要说明的是,MLCommons 公开结果中同配置的对比样本只有五组,且各自底层存储配置存在差异。
为什么重要
大模型训练动辄持续数周,跨成百上千块 GPU 运行。训练过程中必须周期性保存模型权重、优化器状态等检查点文件,同步写检查点期间训练必须暂停,这意味着存储性能直接决定了 GPU 的空转时间:写入越快,暂停越短;读取越快,故障恢复越早。在数百万美元规模的 GPU 集群上,检查点读写时间的细微缩短都会被 GPU 数量放大为可观的算力浪费减少。MLPerf Storage 作为架构中立、可复现的行业标准基准,其价值在于让存储性能从“厂商宣传”变成可横向对比的公开数据,直接影响企业在采购 AI 基础设施时的选型判断。
对用户/开发者/创作者的影响
对于正在搭建或扩展现有 AI 训练基础设施的团队,这一结果提供了具体的选型参考:如果训练任务中存在频繁的检查点操作,或者涉及强化学习、后训练等需要反复保存状态的场景,存储系统不能只关注峰值吞吐,还要看它在高并发小文件写入下的稳定性。OpenLake 的实现细节——基于 io_uring 的异步 I/O、线程绑定、细粒度 I/O 合并以及 XFS 调优——本质上是软件层面的优化,这意味着企业不必只靠堆硬件解决存储瓶颈。开发者如果自建存储,这些技术方向同样可以借鉴。文章没有提及成本信息,企业用户需自行评估其商业版本的经济性。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,OpenLake 计划将基准测试覆盖范围扩展到 KV cache offloading、向量搜索和上下文存储等更多 AI 负载场景。接下来值得关注的三个具体信号:其一,Infinity Core I/O Engine 是否以开源或商业产品形式对外开放,能否被现有训练框架无缝集成;其二,KV cache offloading 的基准成绩是否同样突出,因为这将决定其在推理环节的价值;其三,主流云厂商和存储竞品是否会在下一轮 MLPerf Storage 中跟进提交同场景数据,这将是检验该成绩含金量的直接方式。


