训练和部署前沿模型如今既是计算问题,也是网络问题。诸如 all-reduce 和 all-to-all 之类的集体操作会在训练过程中同步数千个加速器,而速度最慢的传输决定了整个任务的进度。即使是微小的网络摩擦也会直接导致大量计算能力的浪费。
本周,Meta 推出了MetaRoCE。它被描述为一种全新的 RDMA 传输协议,专为在通用以太网上运行的 AI 工作负载而设计。该设计在核心假设上颠覆了标准 RoCE:标准 RoCE 期望网络按序交付每一个帧,依赖 PFC(优先级流控),并抑制那种能在多平面、大规模网络中带来性能优势的数据包喷洒(packet spraying)。而 MetaRoCE 则把网络视为有损的,把排序、路径选择和恢复全部下沉到网卡(NIC)端。Meta 将通过开放计算项目(OCP)发布该规范的正式文档、参考软件实现以及合规性测试套件。

现在能用吗?
还不行,相关交付物预计在 2026 年 10 月发布。Meta 可能将在 2026 年 OCP 全球峰会上发布 MetaRoCE 规范、DPDK 优化的软件参考实现,以及生产级合规框架。硬件支持尚处于早期:Meta 在 AMD Pensando 可编程网卡上完成了验证,其他厂商的实现也在推进中。目前这是一个网络架构层面的决策,而不是采购决策。
问题所在:网络看到的是数据包,网卡看到的才是意图
Meta 已把集群规模扩展到数十万张 GPU,横跨多个数据中心和地域。在这个体量下,网络处于每一次训练步的关键路径上。像 all-reduce 和 all-to-all 这样的集合通信操作会同步数千个加速器,最慢的传输决定了整个作业的节奏。
标准 RoCE 正是瓶颈所在。它期望网络按序交付每一帧,依赖 PFC,并抑制那种能在多平面、大规模网络中带来性能的数据包喷洒。MetaRoCE 则反过来做:智能全部移到端侧,网络被分解为大量细粒度的逻辑路径,每条路径都带自己的实时遥测数据,按路径统计的 RTT、ECN 状态和利用率。
这直接建立在 Meta 2024 年的 RoCE-at-scale 工作及其更广泛的基础设施演进之上。
六个关键设计决策
乱序交付是默认机制:数据包被喷洒到多条路径上,并按设计乱序到达。每个数据包自带目的地,数据落地时直接写入其最终内存位置,无需重排缓冲,无队头阻塞。发送端携带与已投递接收缓冲区(posted receive buffer)的匹配关系,因此即使排在它前面的消息还没到,一个 Send 也能正确落地。
多路径是原生能力:每条路径都用一个独立的 UDP 源端口作为其 ECMP 熵(entropy),网卡可以随时更改它,把流量从故障路由上挪走。由于每条路径都维护自己的拥塞窗口和往返时延估算,传输层能够区分拥塞与故障,并进行显式的再平衡。
损失容忍取代无损:MetaRoCE 把网络视为有损的——没有 PFC,没有暂停帧。某条路径 256 位选择性确认(SACK)位向量上的缺口就是丢包而非乱序的证据,因此会精确触发缺失数据包的重传,并且是在丢包的那条路径上重传。
拥塞控制双端协同:发送端驱动的基于 ECN 的 AIMD(加性增乘性减),与接收端驱动的公平份额速率提示相结合。在每个确认包中,接收端都会返回它分配给该发送端的入站带宽份额,让发送端直接以正确速率逼近,而不是靠摸索收敛。Incast(多对一突发)在一到两个 RTT 内即可解决。
拓扑无关:MetaRoCE 只向网络设备索取两样每台交换机都具备的能力:ECN 标记和 ECMP。它不要求数据包修剪(packet trimming)、网内遥测、基于信用的流控或交换机侧喷洒——这意味着它也能跑在你不掌握配置的云厂商网络上。
连接状态不再爆炸:传统 RDMA 通过打开更多队列对(queue pair)来获得更强的排序或更大的带宽——每对节点之间数十个队列对,各自带着互不可见的拥塞窗口。MetaRoCE 把两者解耦:一个连接之上承载着许多相互独立的排序流,之下承载着许多条路径,统一由同一个拥塞控制器管理。
数据表现
Meta 在 AMD Pensando 可编程网卡上实现了 MetaRoCE。在运行 RCCL 集合通信的 64 节点 AMD GPU 集群上,它与 RoCEv2 在 all-reduce 和 all-to-all 场景下做了直接对比,实现了更高的吞吐量和更低的流完成时间(FCT)。
韧性结果是核心声明:在 1% 丢包率下,MetaRoCE 仍能维持约 86% 的吞吐量;即便在 10% 丢包率下也继续提供可用带宽,优雅收敛而不是崩溃。在 4 平面和 8 平面拓扑、最多 4,000 条并发连接的多平面验证中,吞吐量随平面数量线性扩展;模拟平面故障时,流量在无需应用介入、无需运维干预的情况下自动重新分布。
开放设计
MetaRoCE 将 OCP 的以太网可扩展统一网络(ESUN)计划为网络层面确立的多厂商理念,延伸到了传输层。共交付三样东西:经由 OCP 发布的完整规范、让厂商证明其实现符合规范的合规套件,以及作为芯片开发权威行为模型的 libsoftmetaroce。Meta 已在 AMD Pensando 硬件上完成验证,其他厂商的实现也在推进中。
核心要点
- MetaRoCE 是一种”白纸式”RDMA 传输协议,把以太网视为有损网络——没有 PFC,没有暂停帧。
- 数据包在路径间喷洒并直接写入内存;无重排缓冲,无队头阻塞。
- 在运行 RCCL 的 64 节点 AMD GPU 集群上,1% 丢包率下仍保持约 86% 吞吐量。
- 只要求交换机支持 ECN 和 ECMP,因此可运行在你无法掌控的网络之上。
- 规范、合规套件和 libsoftmetaroce 将于 10 月登陆 OCP 全球峰会。
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/71404.html