Modal Clusters 正式发布,通过 @modal.clustered 提供多节点 GPU 集群

Modal 将打磨约一年半的多节点 GPU 集群能力正式开放,开发者只需一个 @modal.clustered 装饰器,就能在几秒内拉起跨节点、支持 RDMA 的集群来跑大模型训练和推理,并按秒计费。

一句话看懂:Modal 将打磨约一年半的多节点 GPU 集群能力正式开放,开发者只需一个 @modal.clustered 装饰器,就能在几秒内拉起跨节点、支持 RDMA 的集群来跑大模型训练和推理,并按秒计费。

事件核心:发生了什么

Modal 宣布 Modal Clusters 正式 GA。它把原本以单容器为单位的工作负载,扩展成”一组容器”这一新调度单元:示例代码中,@app.function(gpu="B300:8") 配合 @modal.clustered(size=4, rdma=True),即可申请 4 个节点、每节点 8 张 B300,代码里可拿到各容器私有 IP 和 rank,用于分布式训练。节点间通过 InfiniBand RDMA 通信,带宽最高 6.4 Tbps,官方称已自动适配 PyTorch 与 NCCL。集群申请到运行只需数秒,按秒计费,并可与 Volumes、Cloud Bucket Mounts、Queues 等原有能力组合。

为什么重要

大模型训练和推理本质上受制于两件事:算力规模和节点间带宽。原文给出的例子很直观:GLM 4.7 每一步训练要把约 717 GB BF16 权重从训练端同步到 rollout 引擎,50 Gbps TCP 下接近两分钟,走 RDMA 不到两秒;Llama 3.1 70B 做 PD 分离推理时,每个 32k token 提示词要搬运约 10 GB KV cache。Modal 把 RDMA 复杂配置收敛成一个 rdma=True,并在调度层引入”群组调度”(一次性放置 N 个节点),这直接冲击了按小时或预留计费的传统 GPU 集群租赁模式。

对用户/开发者/创作者的影响

对做分布式训练、微调或推理服务的开发者,最实际的改变是接入门槛和成本模型:不用再自己处理多云 RDMA 驱动、环境变量和用户态库差异,也不需要在不用时为空闲集群付费。对预算有限的小团队,这意味着可以用接近 serverless 的方式短时借用多节点集群,跑完就释放。需要注意,目前公开信息显示该能力主要面向 PyTorch + NCCL 工作负载,其他框架的适配程度尚不明确。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是实际可用性:多节点集群在高峰期是否还能”几秒拉起”,以及 B300 等新卡的可获得性。二是价格与计费细节:按秒计费在长时间训练任务上是否仍具性价比,与预留实例相比如何。三是竞品跟进:其他云厂商和 serverless GPU 平台是否会推出类似的一键多节点 + RDMA 抽象。

来源:Modal 官方工程博客(RSS)

celebrityanime
celebrityanime
文章: 26697

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注