谁在给 GPU 喂数据?深入 AI 背后隐藏的 300 亿美元层 | Renen Hallak,VAST Data

VAST Data 联合创始人 Renen Hallak 在 The MAD Podcast 中提出,GPU 集群之外存在一个约 300 亿美元规模的数据供给层——它决定了算力能否真正转化为训练和推理产出,却长期被行业讨论忽略。

一句话看懂:VAST Data 联合创始人 Renen Hallak 在 The MAD Podcast 中提出,GPU 集群之外存在一个约 300 亿美元规模的数据供给层——它决定了算力能否真正转化为训练和推理产出,却长期被行业讨论忽略。

事件核心:发生了什么

在 Matt Turck 主持的 The MAD Podcast 中,VAST Data 联合创始人兼 CEO Renen Hallak 讨论了 AI 基础设施中被低估的一环:谁在为 GPU 持续供给数据。他的核心判断是,围绕 GPU 本身已经形成巨大的资本与舆论聚焦,但让 GPU 保持高利用率的数据存储、读取与调度层,规模约为 300 亿美元,且仍在增长。VAST Data 本身提供面向 AI 工作负载的数据平台,其客户覆盖大模型训练与推理场景,因此这一判断带有明显的产业视角。

为什么重要

训练一个大模型不只是买卡。数据要从存储系统以足够高的吞吐喂给成千上万块 GPU,一旦 I/O 成为瓶颈,昂贵算力就会空转。目前公开信息显示,行业叙事主要集中在芯片、模型和 API 价格上,而存储与数据管道常被当作幕后配套。Hallak 的观点提示:AI 竞争中真正难复制的部分,可能包括数据如何被组织、版本化和复用。对云厂商、模型公司和自建集群的企业来说,算力预算之外的数据层预算正在变成刚性支出,这也解释了大量资金为何流向数据平台和高速存储赛道。

对用户/开发者/创作者的影响

对开发者而言,模型训练和推理的成本不只体现在 GPU 小时单价上。数据加载效率、检查点写入速度、多模态数据集的读取方式,都会直接影响实验迭代节奏,因此选型时需要把存储吞吐和 API 访问模式纳入架构设计。对企业采购来说,如果自建训练集群,数据层是容易被低估的预算项;如果使用云服务,则要留意存储与出网费用是否随数据规模非线性上升。对内容创作者和 AI 应用团队,数据管道质量最终会体现在模型响应速度、生成稳定性和单位调用成本上,而不是一个可单独感知的功能。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是这一约 300 亿美元的市场规模如何被第三方数据验证,以及是否包含存储硬件、软件平台或两者合计。二是 VAST Data 等厂商是否会把数据层能力进一步产品化,例如面向推理场景的缓存、向量检索和权限管理。三是云厂商与 GPU 供应商是否会通过自研数据栈绑定客户,从而改变这一层的竞争格局。

来源:Follow Builders · Podcast · The MAD Podcast with Matt Turck

celebrityanime
celebrityanime
文章: 25518

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注