RoCEv2 · PFC / ECN · DCQCN

面向 AI 集群的 RoCE 与 InfiniBand

RoCEv2 在开放的多厂商以太网上运行 RDMA;InfiniBand 则是单一厂商的无损 fabric。 RoCEv2 借助 PFC 和 ECN 保持无损,并通过 DCQCN 控制拥塞,而 InfiniBand 则通过基于信用的流控在设计上即无损。对多数 AI 工作负载而言,采用 RoCEv2 的以太网如今已能与 InfiniBand 比肩,同时保留硬件选择自由。本页将逐项对比两者。

UDP 4791RDMA 在三层可路由
最高 800G开放 RoCEv2 fabric
1 contractOcNOS-DC + 经过验证的硬件
600+基于 OcNOS 的运营商网络
两种 fabric,两种保持无损的方式

同样的 GPU,两种保持无损的方式

左:基于以太网的 RoCEv2 通过逐跳 PFC 暂停、交换机上的 ECN 标记,以及回到发送端 NIC 的 DCQCN 速率控制,让队列保持浅层。右:InfiniBand 采用基于信用的流控,仅在接收端已通告缓冲信用时才发送。两者都能避免丢包;一者运行在开放的多厂商以太网上,另一者运行在单一厂商 fabric 上。

RoCEv2 PFC/ECN/DCQCN loop versus InfiniBand credit-based flow control Two side-by-side diagrams. Left: a sending GPU NIC and a receiving GPU NIC connected through an Ethernet switch running OcNOS-DC. PFC pause acts hop-by-hop, the switch marks ECN on congestion, and a DCQCN signal returns to the sending NIC to lower its rate. Right: an InfiniBand switch and adapter exchanging buffer credits, so a sender transmits only when the receiver has advertised credit. Bottom band contrasts open multi-vendor Ethernet with a single-vendor InfiniBand fabric. RoCEv2 · OPEN ETHERNET INFINIBAND · SINGLE-VENDOR GPU NICsender SwitchOcNOS-DC · TH5 GPU NICreceiver ECN mark PFC pause (hop-by-hop) DCQCN rate control to sender PFC + ECN keep the fabric lossless · DCQCN controls congestion IB Switchsubnet manager GPU HCAIB adapter data (only if credits > 0) buffer credits Credit-based flow control · lossless by design · single ecosystem OPEN MULTI-VENDOR ETHERNET vs SINGLE-VENDOR INFINIBAND FABRIC
对比情况

RoCE 与 InfiniBand,逐项对比

RoCE 即 RDMA over Converged Ethernet;对 AI 而言重要的版本是 RoCEv2,它把 RDMA 封装进 UDP/IP(目的端口 4791),使流量可在三层以太网 fabric 上路由。InfiniBand 则是 InfiniBand Trade Association 专门构建的互连,通过基于信用的流控在架构上即无损。对 AI 集群而言,务实的问题是:哪种传输既能满足工作负载,又能让成本、供应链和运维保持在合理范围。

Axis RoCE基于以太网的 RoCEv2,开放 InfiniBand单一厂商 fabric
Transport & standard基于 UDP/IP 的 RDMA(RoCEv2,IBTA),在三层通过 UDP 目的端口 4791 可路由。承载于标准 IEEE 以太网之上。专门构建的 InfiniBand 链路层与传输层(IBTA),配以专用交换机和主机通道适配器。
如何保持无损以 PFC 进行逐跳流控,再以 ECN 配合 DCQCN 进行端到端拥塞控制,让交换机队列保持浅层,从而使 RDMA 避免丢包。基于信用的流控:发送端仅凭接收端已通告的缓冲信用发送,因此 fabric 在设计上即无损。
生态系统每一层都是开放、多厂商的:交换 ASIC、交换机、NIC、NOS 和光模块均来自独立供应商。在 NIC 和交换芯片上实际是单一厂商;fabric、适配器和管理作为一套整体栈提供。
交换芯片选择Broadcom Tomahawk 5(51.2 Tbps,64x800G)和 Tomahawk 4(25.6 Tbps,64x400G),涵盖 Edgecore、UfiSpace 等多个平台。仅有来自 InfiniBand 厂商的芯片;没有独立的 ASIC 或交换机供应。
拥塞控制端到端 DCQCN:交换机标记 ECN,发送端 NIC 降低速率。自适应负载均衡(DLB)分散流量,并在本地拥塞时重新均衡。基于信用的流控,自适应路由已内置于规范之中。
Scale在 Tomahawk 5 上,两级 fabric 在 1:1 时约达 2,048 个 GPU(借助 800G 拆分可达 8,000+);三级 Clos 可扩展到 16,000+,最多约 65,535 个端点。在单一厂商的 fabric 内,通过由集中式子网管理器管理的 fat-tree 拓扑进行扩展。
Operations & tooling标准以太网运维:BGP、EVPN、gNMI/OpenConfig 遥测,以及数据中心通用的同一套自动化(Ansible、NETCONF)。专门的 InfiniBand 工具和子网管理器,独立于数据中心其余部分的运营模式。
厂商锁定本质上没有:可自由搭配硬件与软件,并为供应链引入第二供货源。高:NIC、交换机、布线和管理通常来自单一厂商。
Cost trend运行 OcNOS-DC 的开放硬件 spine 在 400G 和 800G 下的成本显著低于单一厂商 fabric,且随着端口速率提升,差距进一步扩大。在同等容量下,单一厂商定价存在溢价。

InfiniBand 是 InfiniBand Trade Association 的商标。NVIDIA 和 Mellanox 是其各自所有者的商标。本对比仅供参考,不暗示任何隶属关系或背书。

选型决策

各自的制胜场景

正确答案因工作负载而异。当绝对延迟下限是硬性要求时,选 InfiniBand;当运营模式、成本或跨站点覆盖决定成败时,选 RoCE。

InfiniBand 适用于

延迟下限即是硬指标

在绝对 NIC 到 NIC 延迟下限比总拥有成本更重要的紧耦合 HPC 仿真场景,以及可接受单一厂商栈的封闭式单租户集群中。

RoCE 适用于

运维与供应链才是关键

多租户 GPU 即服务,以及与数据中心其余部分共享同一运营模式、同一工具栈和多厂商供应链的 AI 后端。

RoCE 适用于

每 GPU 成本是决定门槛

开放硬件 spine 加上 OcNOS-DC 消除了单一厂商的网络溢价。在数千 GPU 规模的构建上,这在硬件预算中占据可观的份额。

RoCE 适用于

fabric 需要跨越多个数据中心

借助 400G ZR/ZR+ 相干光模块,以太网可自然地跨机房和跨区域延伸,无需单独的长距网关层。

开放路径

OcNOS-DC 如何交付 RoCEv2 路径

OcNOS-DC 提供 RoCEv2 所需的无损以太网底座。交换机提供避损与拥塞原语;RoCEv2 则是运行在 NIC 上的传输。这些都是 OcNOS-DC 如今已经过验证的交换机能力。

Losslessness

PFC and ECN

优先级流控(PFC),包括在三层通过 DCBX/LLDP 实现的带 QoS 的 PFC,以及 ECN 和 Dynamic ECN,让 RDMA 流保持浅队列且不丢包。

Congestion

DCQCN 标记

交换机标记 ECN,使端到端的 NIC 加交换机的 DCQCN 环 得以对发送端限速。ETS 和 WRED 对承载 RDMA 的队列进行整形与管理。

负载均衡

DLB 与 RTAG7

动态负载均衡 (包括 Reactive Path Rebalance 和 Random Flow),配合 RTAG7 哈希,分散集合通信流量并在本地拥塞时重新均衡。

Resilience

PFC 死锁保护

PFC 死锁检测与恢复 ,加上缓冲调优,让无损 fabric 在 PFC 可能引发的暂停传播下保持稳定。

遥测

gNMI / OpenConfig

Streaming gNMI 和 OpenConfig 遥测 在集群上线调试和稳态运行期间,提供按优先级的可见性以支持闭环调优。

UEC-ready

与 UEC 1.0 对齐

IP Infusion 是 Ultra Ethernet 联盟的贡献成员,OcNOS-DC 与 UEC 1.0 网络配置文件对齐,因此随着 UEC 能力 NIC 上市,fabric 得以延续。对齐并不构成认证声明。

芯片选择是开放的:OcNOS-DC 运行在基于 Broadcom Tomahawk 5 的 Edgecore AIS800-64D 和 UfiSpace S9321-64E / S9321-64EO(-64EO 增加 400G ZR+)上,以及基于 Tomahawk 4 的 Edgecore AS9736-64D 上,这些都是为 RoCEv2 调优的片上共享缓冲平台。一份 IP Infusion 合同即涵盖软件和经过验证的硬件,并配以一个 TAC 和一个 SLA。

为何转变

为何许多运营商在 AI 后端转向以太网

这一转变更多关乎运营与经济,而非纯粹的延迟。在大规模构建中,三点因素会迅速累积:与数据中心其余部分共享的统一网络模型、多厂商供应链,以及在 400G 和 800G 下更低的每端口成本。

其规模已在现场得到验证。Meta 曾描述在一个 24,000-GPU 集群上,通过 RoCE 以太网 fabric 训练其最大的模型——这一规模曾被认为必须依赖 InfiniBand。Tomahawk 4 和 Tomahawk 5 上的自适应负载均衡会根据实时拥塞重新绑定流量,因此在静态哈希会导致利用率受困之处,运维良好的 fabric 可将目标利用率设定在 90% 以上。90% 是设计目标,而非实测保证。

InfiniBand 仍存的优势——更低的绝对延迟下限——对一部分紧耦合 HPC 工作负载依然重要。而对大多数大规模分布式训练和推理集合通信而言,一张正确调优的 RoCEv2 fabric 的表现低于会改变作业完成时间的阈值,这正是运营与经济理由如今决定多数新建 AI 后端的原因。

  • 与数据中心其余部分共享的统一网络模型,因此技能和工具得以沿用。
  • 多厂商供应链,让您能为芯片、交换机、NIC 和光模块引入第二供货源。
  • 在 400G 和 800G 下更低的每端口成本,为更多 GPU、更大的存储层或第二站点释放资本。
简而言之

两者都成立,而多数新建 AI 后端落在以太网上

InfiniBand 保有更低的绝对延迟下限,一部分紧耦合 HPC 工作负载会一直为此买单。而对多数 AI 后端构建而言,运营与经济理由的天平倾向于基于开放以太网的 RoCEv2。

两者都成立

InfiniBand 保有更低的绝对延迟下限,一部分紧耦合 HPC 工作负载会一直为此买单。

RoCEv2 已为 AI 弥合差距

在正确配置 PFC、ECN、DCQCN 和自适应负载均衡后,以太网在多数分布式训练集合通信上已能与 InfiniBand 比肩,同时保留硬件选择自由。

决策通常取决于运营

统一的网络模型、多厂商供应链,以及在 400G 和 800G 下更低的每端口成本,决定了多数新建 AI 后端。

OcNOS-DC 是通往开放的路径

如今即拥有经过验证的 RoCEv2 原语,并为未来与 UEC 1.0 对齐,运行在来自 Edgecore 和 UfiSpace 的经过验证的开放硬件上,且在一份合同、一个 TAC 和一个 SLA 之下。

常见问题

RoCE 与 InfiniBand 常见问题解答

RoCE 与 InfiniBand 有何区别?
RoCE(实践中即 RoCEv2)通过标准的、可路由的以太网和 IP 承载 RDMA,因此可复用任意厂商都能供应的交换机、NIC、光模块和运维工具。InfiniBand 则是一张独立的专用 fabric,拥有来自单一厂商的自有交换机、适配器、布线和子网管理器。RoCEv2 借助 PFC 和 ECN 让 fabric 保持无损,并通过 DCQCN 控制拥塞,而 InfiniBand 依靠在设计上即无损的基于信用的流控。
在 AI 场景中,以太网和 InfiniBand 一样快吗?
对多数大规模分布式训练集合通信而言,是的。InfiniBand 在绝对延迟下限上仍低数百纳秒,但一旦 RoCEv2 配置了 PFC、ECN、DCQCN 和自适应负载均衡,对大多数 AI 工作负载而言,这一差距便低于会改变作业完成时间的水平。正因如此,如今许多运营商已在以太网上运行大型 AI 后端网络。
什么是 RoCEv2?
RoCEv2(RDMA over Converged Ethernet 第 2 版)把 RDMA 封装进 UDP/IP(目的端口 4791),因此 RDMA 流量可在三层以太网 fabric 上路由。它让 GPU 和存储以低延迟、低 CPU 占用在内存之间直接搬移数据,这正是它成为在开放的多厂商以太网上运行 RDMA 的主流方式的原因。
RoCE 需要无损 fabric 吗?
需要。当数据包被丢弃时,RoCEv2 性能会急剧下降,因此它需要一张无损或近无损的 fabric。运营商通过 PFC 进行逐跳流控,并以 ECN 配合 DCQCN 进行端到端拥塞控制来实现这一点,让交换机队列保持浅层,从而使 RDMA 流避免丢包和重传。交换机提供无损底座;RoCEv2 则是运行在 NIC 上的传输。
我能在开放交换机上运行 RoCE 吗?
可以。RoCEv2 运行在标准以太网芯片上。OcNOS-DC 在经过验证的开放硬件上交付 RoCEv2 各构建模块(PFC、三层带 QoS 的 PFC、ECN、Dynamic ECN、ETS、WRED、DLB、PFC 死锁检测与恢复,以及 gNMI/OpenConfig 遥测),例如基于 Broadcom Tomahawk 4 和 Tomahawk 5 的 Edgecore 和 UfiSpace 平台。一份 IP Infusion 合同即涵盖软件和经过验证的硬件。
那 Ultra Ethernet 呢?
Ultra Ethernet(UEC)是一项开放标准,为以太网带来数据包喷洒、多路径 RDMA、乱序交付和现代拥塞控制,缩小了曾经唯 InfiniBand 独有的能力差距。IP Infusion 是 Ultra Ethernet 联盟的贡献成员,OcNOS-DC 如今即与 UEC 1.0 fabric profile 对齐,完整的 UEC 传输将随 UEC 能力 NIC 上市而启用。与该 profile 对齐并不构成认证声明。

在对比 InfiniBand 为 RoCEv2 fabric 设定规格?让我们一起做针对具体工作负载的测算

告诉我们工作负载和 GPU 规模,IP Infusion 的工程师将与您一起测算,或先在 AI Fabric Design Suite 中生成一版初步的 leaf-spine 布局。