一句话看懂:多集群 Kubernetes 编排项目 Karmada 正式从 CNCF 毕业,意味着这项技术在生产环境中的成熟度得到官方认可,其后续将重点解决大模型训练中跨集群 GPU 调度与异构算力管理问题。
事件核心:发生了什么
9 月 8 日,在上海举行的 KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026 大会上,CNCF 宣布 Karmada 项目正式毕业。该项目于 2021 年进入 CNCF Sandbox,2023 年晋升至 Incubating 阶段,约五年时间走完了 CNCF 项目成熟度体系的主要阶段。截至目前,Karmada 拥有超过 1214 名贡献者,来自 292 家组织,GitHub Star 数超过 5600。
Karmada 主要解决 Kubernetes 从单集群扩展到多集群、多云和多区域后的应用编排问题,在无需应用修改原有资源定义的前提下提供集中部署、资源分发、故障转移和多集群自动伸缩能力。其最新的 v1.19 版本强化了针对分布式 AI 训练任务的多组件调度,并将基于优先级的调度能力提升至 Beta 且默认启用,以便在 GPU 等稀缺资源竞争激烈时按优先级分配资源。
为什么重要
Karmada 毕业的时间点值得关注。过去几年,Kubernetes 主要解决单集群容器编排问题,但随着企业基础设施跨数据中心、跨云、跨地域分布,以及大模型训练对 GPU、NPU 等异构算力的大规模依赖,基础设施的核心挑战正从“如何管理一个集群”转向“如何管理一组甚至大规模集群”。AI 训练任务对算力规模、资源利用率和故障恢复能力的要求,放大了这一问题的紧迫性。
CNCF 项目毕业不仅是功能成熟的标志,也意味着项目在治理、安全、社区活跃度和生产采用方面达到标准。Karmada 已完成第三方安全审计、建立正式 Steering Committee、获得 CII Best Practices Badge,并拥有来自六家组织的 Maintainer。根据其 2026 年路线图,项目将继续推进基于优先级的抢占、多集群 AI 训练与批处理任务队列,以及 Kubernetes Dynamic Resource Allocation(DRA)在 GPU 和其他加速器上的多集群支持,定位逐步从“跨集群工作负载分发”向能感知资源类型、任务优先级和异构计算资源的多集群控制平面演进。
对用户/开发者/创作者的影响
对于平台工程团队和 AI Infra 开发者,Karmada 的价值在于无需修改应用原有 Kubernetes 资源定义即可将分散在不同数据中心、公有云或地域的集群组成统一资源池,并借助基于优先级的调度能力在 GPU 竞争环境中确保高优任务先获得资源。其控制平面直接导出 Prometheus 指标、状态经 etcd 保存、提供 Helm Chart 部署,与现有 Kubernetes 和 CNCF 工具链兼容,降低了引入多集群管理的工程成本。目前公开信息显示,其生产用户已覆盖云计算、互联网、通信、AI、旅游、物流和设备制造等领域,包括 Alibaba Cloud、Bilibili、Bloomberg、Huawei、iFLYTEK、JDCloud、Kuaishou、RedNote、SenseTime、Trip.com、Vivo、WPS、ZTO 及 Wellhub 等,使用场景从简单多集群应用发布延伸至混合云容量管理、多区域容灾、智能流量分发、AI 训练与 GPU/CPU 调度。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
首先是 v1.19 中默认启用的优先级调度在实际 AI 训练场景中的表现,观察其与 Kubernetes 原生抢占机制的协同效果。其次是路线图中 DRA 在 GPU 和其他加速器上的多集群支持是否能在后续版本中按计划落地,这将直接影响大模型训练集群的资源利用效率。此外,Bloomberg 等 Maintainer 所在组织已表示使用 Karmada 自动化灾难恢复并简化多集群管理,其灾难恢复自动化方案能否进一步产品化、形成可复用的最佳实践,也是值得观察的方向。
来源:InfoQ CN


