Cursor发布MoK训练内核,将MoE通信与计算融合为单一确定性核,在GB300 NVL72上比最强baseline快2.37倍。
人工智能
Cursor Research 宣布开源 Mixture-of-Kittens(MoK),这是其 Composer 模型背后的混合专家(MoE)训练 megakernel。MoK 将所有 MoE 通信和计算步骤融合到一个确定性 kernel 中。Cursor 团队报告称,吞吐量比最强的公开基线高出 2.37 倍。MoK 已经在数万块 GPU 上驱动 Composer 的训练。
不过,硬件门槛很高。MoK 以 Apache-2.0 协议开源在 GitHub 上。它需要 NVIDIA Blackwell SM100 或 SM103 GPU,这意味着 GB200 NVL72 或 GB300 NVL72 机架。它还需要 Python 3.12+、PyTorch 2.10+ 和 CUDA Toolkit 13.0+。GPU 间缓冲区依赖 PyTorch 对称内存。
这意味着实际使用者仅限于拥有或租用 NVL72 容量的组织。前沿实验室、有资金支持的模型创业公司、GPU neocloud 和国家计算中心符合条件。单节点团队和 8-GPU 配置则不适合。
应用场景狭窄但价值高。包括 DeepSeek-V3 风格 MoE 模型的预训练和后训练。确定性特性也使其适用于 on-policy RL 后训练和内部消融实验。相关行业包括 AI 模型开发、云端 GPU 基础设施、代码生成工具和量化研究。
Cursor 早期的工作覆盖了计算侧。研究团队编写了自己的 MXFP8 和 NVFP4 训练 kernel,以及一条用于 MoE 推理的"warp decode"路径。这些都假设 GPU 间通信是独立处理的。
在生产环境中,通信成为限制因素。MoE 层消耗了超过一半的端到端训练时间。迁移到 GB300 NVL72 后问题再次改变。一个机架内有 72 块 GPU 处于同一个 NVLink 域,这允许细粒度重叠。但集成的 Grace CPU 相对于 GPU 较慢。因此必须激进地最小化 CPU-GPU 同步。
通信方向按操作选择:现有方法如 DeepEP 依赖 push 式传输。Cursor 的微基准测试表明,push 方式在同一方向上移动的总字节数更少,导致反向 NVLink 通道基本闲置。基于 pull 的调度在专家负载不均衡时可将 NVLink 带宽利用率提高 29%。它还消除了跨 GPU 完成信号。Push 调度信号测量为 103 µs,而 pull 为 18 µs,约为 5.8 倍的差距。因此 MoK 采用基于 pull 的前向调度和基于 push 的前向合并。反向传播镜像这一设计:pull 反向合并和 push 反向调度。一张调度表服务所有四种模式,耗时不到 MoE 运行时间的 3%。
重叠粒度介于两个极端之间:Comet 是细粒度;DeepEP 是粗粒度。Cursor 团队认为最优解在中间且与工作负载相关。该启发式方法的目标是每个专家分组的 GEMM 至少有两个完整的 SM wave。对于 Kimi 2.5 形状(Composer 2.5 的基础模型),下限是 2,368 个 token。测量延迟与该估计值紧密吻合。
环形 token 缓冲区将 CPU 排除在循环之外:替代方案是丢弃 token 或让 CPU 估算缓冲区大小。MoK 则循环使用一个几百兆字节的固定环形缓冲区。它以 minibatch 粒度进行操作,在 macrobatch 边界交错调度和合并。环形缓冲区反向遍历,以最小化反向传播期间的前向激活回放。
MoK 构建为一个 megakernel,且完全确定性。它支持 BF16 和 MXFP8 精度模式。调度通过 Blackwell 的 Cluster Launch Control 运行,因此机架间 RDMA 不会在其后序列化。路由权重梯度使用融合到 SwiGLU 反向传播中的 SonicMoE 风格计算。
https://cursor.com/blog/mixture-of-kittens

层基准测试在单个 NVL72 机架上进行,EP 度为 64。每块 GPU 在路由前持有 2,048 个 token。基线包括 NCCL+PyTorch、DeepEP+PyTorch、DeepEP+TransformerEngine 和 HybridEP+Megatron。形状覆盖了 Kimi K2.7 Code、GLM-5.2、Qwen3.5-397B-A17B 和 DeepSeek-V4-Pro。
对比最快的基线,MoK 在 MXFP8 前向传播上最快达到 2.37 倍加速。其他数据包括:MXFP8 反向传播 1.78 倍、BF16 前向传播 1.92 倍、BF16 反向传播 1.58 倍。端到端测试在多个 GB300 NVL72 机架上使用 512 块 GPU 进行。每 GPU 每秒 token 数从 760.9 上升到 1,070.2,提升 1.41 倍。
查看 GitHub Repo 和技术详情。也欢迎在 Twitter 上关注我们,不要忘记加入我们的 15 万+ ML SubReddit 并订阅我们的 Newsletter。等一下!你用 telegram 吗?现在你也可以加入我们了。
想与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会吗?联系我们
Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻而著称,内容既技术严谨又通俗易懂。该平台每月浏览量超过 200 万次,显示出其在受众中的受欢迎程度。