一句话看懂:Cursor 开源了面向 GB300 NVL72 机架优化的确定性 MoE 训练 Megakernel——Mixture-of-Kittens(MoK)。它试图解决大规模混合专家模型训练中计算不确定性和通信开销问题,是少见的针对特定硬件的系统级开源项目。
事件核心:发生了什么
据 MarkTechPost Research 报道,Cursor 于 2026 年 8 月 4 日宣布开源 Mixture-of-Kittens(MoK):一个面向 NVIDIA GB300 NVL72 机架设计的确定性 MoE(Mixture of Experts)训练 Megakernel。目前公开信息显示,这个项目不是一个新模型,而是一套训练内核实现——它把 MoE 模型在训练过程中多个离散、动态的计算步骤合并成一个更可控的 Megakernel,从而减少 GPU 之间的同步等待和调度抖动。选择“Mixture-of-Kittens”这一命名,一方面是对 MoE 的谐音和致敬,另一方面也暗示其针对“小模型、多专家”组合的训练场景做了专门优化;而“确定性”则意味着在相同输入和硬件条件下,训练计算的执行路径更为稳定、可复现。
为什么重要
MoE 是当前大模型扩展算力的主流路线之一,但它的训练效率长期受制于专家路由带来的动态负载不均和 kernel 启动开销。GB300 NVL72 是 NVIDIA 主推的整机柜级 AI 系统,把 72 颗 GPU 通过高速互联整合成单一可寻址资源。MoK 的价值在于,它把“MoE 训练算法”和“特定机架硬件”做了联合优化:开发者不再需要在 PyTorch 层手动拼接多个 kernel,或用自定义 CUDA 代码处理设备间通信,而是直接调用一个针对 GB300 NVL72 拓扑调优的确定性内核。对于 Cursor 这样的 AI 编程工具公司来说,开源这一底层基础设施,既有利于建立开发者信任,也可能间接推动自家 IDE 和 Agent 产品在 MoE 训练场景中的渗透。
对用户/开发者/创作者的影响
对算法工程师和 AI 基础设施团队来说,MoK 提供了一个可以直接评估的参考实现:如果团队正在使用 GB300 NVL72 机架训练 MoE 模型,可以尝试用它替代手写的训练内核,观察吞吐、显存占用和训练可复现性是否改善。对于普通应用开发者或创作者,MoK 本身不产生可直接使用的 API 或生成界面,但它是底层算力优化的一部分;未来若 Cursor 将其能力整合进模型训练平台或云服务,可能间接降低 MoE 微调成本。需要留意的是,该内核目前面向的是 72 卡级整机柜环境,个人开发者和小团队短期内很难直接受益,更多是面向企业和云厂商的基础设施资产。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
有几个具体观察点值得跟进:第一,MoK 在不同规模 MoE 模型上的实测收益——是只对特定专家数量生效,还是具备通用性;第二,Cursor 是否会随之发布配套的 API 或云训练服务,将这一内核产品化;第三,其他训练框架(如 PyTorch、JAX)和主流 MoE 项目是否会主动适配或借鉴 MoK 的确定性设计思路,形成事实标准,还是只停留在单机架专用优化层面。


