Meta 发布自研 RDMA 传输协议 MetaRoCE,解决大规模 AI 训练中 all-reduce/all-to-all 通信的网络瓶颈问题,可在标准以太网基础上实现接近 InfiniBand 的性能,显著降低集群组网成本。
训练和 Serving 前沿模型如今既是计算问题,也是网络问题。All-reduce 和 all-to-all 等集合操作在训练期间同步数千块加速器,而最慢的那次传输决定了整个任务的节奏。即使网络摩擦很小,也会直接导致大量计算能力被闲置。
本周,Meta 发布了 MetaRoCE。它被描述为一张白纸(clean-sheet)设计的 RDMA 传输协议,专为 commodity Ethernet 上的 AI 工作负载打造。该设计在核心假设上与标准 RoCE 分道扬镳。标准 RoCE 期望网络按序交付每一个帧,依赖 PFC,不鼓励在多平面和大尺度网络中提供性能的分组喷洒(packet spraying)。MetaRoCE 则将网络视为有损的,把排序、路径选择和恢复推给 NIC 处理。Meta 通过 Open Compute Project(OCP)发布规范文档、一个参考软件实现和一套合规测试套件。
尚无定论,相关成果可能于 2026 年 10 月出货。Meta 可能在 2026 年 OCP Global Summit 上发布 MetaRoCE 规范、一个 DPDK 优化的软件参考实现及其生产合规框架。硬件支持尚处早期:Meta 在 AMD Pensando 可编程 NIC 上验证了它,其他厂商的实现也在推进中。目前这还是一个网络架构决策,不是采购决策。
Meta 已在多个数据中心和区域将集群扩展到数十万 GPU 的规模。在此规模下,网络处于每个训练步骤的关键路径上。All-reduce 和 all-to-all 等集合操作同步数千块加速器,而最慢的那次传输决定了整个任务的节奏。
标准 RoCE 是瓶颈所在。它期望网络按序交付每一个帧,依赖 PFC,不鼓励在多平面和大尺度网络中提供性能的分组喷洒。MetaRoCE 则反转了这一点:智能移到端点,网络分解为许多细粒度的逻辑路径,每条路径有自己的实时遥测——每路径 RTT、ECN 状态和利用率。
这直接建立在 Meta 2024 年大规模 RoCE 工作及其更广泛的基础设施演进之上。
乱序交付是默认行为: 分组在多条路径上喷洒,抵达时天然乱序。每个分组携带自己的目的地,数据到达后直接写入最终内存位置——无需重排序缓冲区,无队首阻塞。发送方携带匹配信息到已 Posted 的接收缓冲区,因此即使先到的消息尚未抵达,Send 也能正确落位。
多路径是原生特性: 每条路径以不同的 UDP 源端口作为 ECMP 熵,NIC 可随时更改它以将流量迁离故障路由。因为每条路径维护自己的窗口和往返估计,传输层可以区分拥塞和故障并显式重平衡。
丢包容忍替代无丢包: MetaRoCE 将网络视为有损的——无 PFC,无暂停帧。路径的 256 位选择确认比特向量中出现间隙,是丢包的证据而非重排序,因此会精确触发缺失分组的重传,在丢失的那条路径上。
拥塞控制双端运行: 发送方驱动的基于 ECN 的 AIMD 与接收方驱动的公平份额速率提示相结合。在每个确认中,接收方返回分配给该发送方的入站带宽份额,因此发送方直接接近正确速率而非搜索它。Incast 在一到两个往返时间内解决。
拓扑无关: MetaRoCE 只向网络要求每台交换机已有两样东西:ECN 标记和 ECMP。它不需要分组修剪、网络内遥测、基于信用的流控制或交换机侧喷洒——这意味着它也可以运行在你无法控制配置的厂商云上。
连接状态不再爆炸: 传统 RDMA 通过打开更多队列对来获得更高顺序或带宽——每对节点数十个——每个队列对的拥塞窗口彼此看不见。MetaRoCE 将两者分离:一条连接在上层携带多条独立有序流,在下层携带多条路径,共用一个拥塞控制器。
Meta 在 AMD Pensando 可编程 NIC 上实现了 MetaRoCE。在一个运行 RCCL 集合操作的 64 节点 AMD GPU 集群上,它与 RoCEv2 在 all-reduce 和 all-to-all 上进行了直接对比,实现了更高吞吐量和更低的流完成时间。
弹性结果是核心陈述:MetaRoCE 在 1% 丢包率下保持约 86% 吞吐量,在 10% 丢包率下仍持续提供有效带宽,优雅收敛而非崩溃。在最多 4,000 个并发连接、4 平面和 8 平面拓扑上的多平面验证确认吞吐量随平面数线性扩展,模拟平面故障显示流量在无需应用参与或运维干预的情况下重新分布。
MetaRoCE 将 OCP 的 Ethernet Scalable Unified Network(ESUN)倡议为网络层确立的多厂商理念扩展到传输层。三项成果出货:通过 OCP 发布完整规范、让厂商证明其实现匹配的合规套件,以及 libsoftmetaroce 作为芯片开发的权威行为模型。Meta 已在 AMD Pensando 硬件上验证了它,其他厂商的实现也在推进中。
MetaRoCE 是一张白纸设计的 RDMA 传输,将 Ethernet 视为有损的——无 PFC,无暂停帧。
分组沿路径喷洒直接写入内存;无需重排序缓冲区,无队首阻塞。
在运行 RCCL 的 64 节点 AMD GPU 集群上,1% 丢包下保持约 86% 吞吐量。
只需交换机提供 ECN 和 ECMP,因此可运行在你无法控制的网络上。
规范、合规套件和 libsoftmetaroce 将于 10 月的 OCP Global Summit 落地。
点击此处查看技术细节。
另外,欢迎关注我们的 Twitter,别忘了加入我们 15 万+的 ML SubReddit 并订阅我们的 Newsletter。等一下!你用 telegram 吗?现在也可以加入我们了。
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能造福社会。他最新的事业是推出了一个人工智能媒体平台 Marktechpost,该平台以前沿的机器学习和深度学习新闻的深入报道著称,既技术扎实又通俗易懂。该平台月浏览量超过 200 万次,彰显了其受众间的受欢迎程度。