面向 AI 集群的 RoCE 与 InfiniBand
RoCEv2 在开放的多厂商以太网上运行 RDMA;InfiniBand 则是单一厂商的无损 fabric。 RoCEv2 借助 PFC 和 ECN 保持无损,并通过 DCQCN 控制拥塞,而 InfiniBand 则通过基于信用的流控在设计上即无损。对多数 AI 工作负载而言,采用 RoCEv2 的以太网如今已能与 InfiniBand 比肩,同时保留硬件选择自由。本页将逐项对比两者。
同样的 GPU,两种保持无损的方式
左:基于以太网的 RoCEv2 通过逐跳 PFC 暂停、交换机上的 ECN 标记,以及回到发送端 NIC 的 DCQCN 速率控制,让队列保持浅层。右:InfiniBand 采用基于信用的流控,仅在接收端已通告缓冲信用时才发送。两者都能避免丢包;一者运行在开放的多厂商以太网上,另一者运行在单一厂商 fabric 上。
RoCE 与 InfiniBand,逐项对比
RoCE 即 RDMA over Converged Ethernet;对 AI 而言重要的版本是 RoCEv2,它把 RDMA 封装进 UDP/IP(目的端口 4791),使流量可在三层以太网 fabric 上路由。InfiniBand 则是 InfiniBand Trade Association 专门构建的互连,通过基于信用的流控在架构上即无损。对 AI 集群而言,务实的问题是:哪种传输既能满足工作负载,又能让成本、供应链和运维保持在合理范围。
| Axis | RoCE基于以太网的 RoCEv2,开放 | InfiniBand单一厂商 fabric |
|---|---|---|
| Transport & standard | 基于 UDP/IP 的 RDMA(RoCEv2,IBTA),在三层通过 UDP 目的端口 4791 可路由。承载于标准 IEEE 以太网之上。 | 专门构建的 InfiniBand 链路层与传输层(IBTA),配以专用交换机和主机通道适配器。 |
| 如何保持无损 | 以 PFC 进行逐跳流控,再以 ECN 配合 DCQCN 进行端到端拥塞控制,让交换机队列保持浅层,从而使 RDMA 避免丢包。 | 基于信用的流控:发送端仅凭接收端已通告的缓冲信用发送,因此 fabric 在设计上即无损。 |
| 生态系统 | 每一层都是开放、多厂商的:交换 ASIC、交换机、NIC、NOS 和光模块均来自独立供应商。 | 在 NIC 和交换芯片上实际是单一厂商;fabric、适配器和管理作为一套整体栈提供。 |
| 交换芯片选择 | Broadcom Tomahawk 5(51.2 Tbps,64x800G)和 Tomahawk 4(25.6 Tbps,64x400G),涵盖 Edgecore、UfiSpace 等多个平台。 | 仅有来自 InfiniBand 厂商的芯片;没有独立的 ASIC 或交换机供应。 |
| 拥塞控制 | 端到端 DCQCN:交换机标记 ECN,发送端 NIC 降低速率。自适应负载均衡(DLB)分散流量,并在本地拥塞时重新均衡。 | 基于信用的流控,自适应路由已内置于规范之中。 |
| Scale | 在 Tomahawk 5 上,两级 fabric 在 1:1 时约达 2,048 个 GPU(借助 800G 拆分可达 8,000+);三级 Clos 可扩展到 16,000+,最多约 65,535 个端点。 | 在单一厂商的 fabric 内,通过由集中式子网管理器管理的 fat-tree 拓扑进行扩展。 |
| Operations & tooling | 标准以太网运维:BGP、EVPN、gNMI/OpenConfig 遥测,以及数据中心通用的同一套自动化(Ansible、NETCONF)。 | 专门的 InfiniBand 工具和子网管理器,独立于数据中心其余部分的运营模式。 |
| 厂商锁定 | 本质上没有:可自由搭配硬件与软件,并为供应链引入第二供货源。 | 高:NIC、交换机、布线和管理通常来自单一厂商。 |
| Cost trend | 运行 OcNOS-DC 的开放硬件 spine 在 400G 和 800G 下的成本显著低于单一厂商 fabric,且随着端口速率提升,差距进一步扩大。 | 在同等容量下,单一厂商定价存在溢价。 |
InfiniBand 是 InfiniBand Trade Association 的商标。NVIDIA 和 Mellanox 是其各自所有者的商标。本对比仅供参考,不暗示任何隶属关系或背书。
各自的制胜场景
正确答案因工作负载而异。当绝对延迟下限是硬性要求时,选 InfiniBand;当运营模式、成本或跨站点覆盖决定成败时,选 RoCE。
延迟下限即是硬指标
在绝对 NIC 到 NIC 延迟下限比总拥有成本更重要的紧耦合 HPC 仿真场景,以及可接受单一厂商栈的封闭式单租户集群中。
运维与供应链才是关键
多租户 GPU 即服务,以及与数据中心其余部分共享同一运营模式、同一工具栈和多厂商供应链的 AI 后端。
每 GPU 成本是决定门槛
开放硬件 spine 加上 OcNOS-DC 消除了单一厂商的网络溢价。在数千 GPU 规模的构建上,这在硬件预算中占据可观的份额。
fabric 需要跨越多个数据中心
借助 400G ZR/ZR+ 相干光模块,以太网可自然地跨机房和跨区域延伸,无需单独的长距网关层。
OcNOS-DC 如何交付 RoCEv2 路径
OcNOS-DC 提供 RoCEv2 所需的无损以太网底座。交换机提供避损与拥塞原语;RoCEv2 则是运行在 NIC 上的传输。这些都是 OcNOS-DC 如今已经过验证的交换机能力。
PFC and ECN
优先级流控(PFC),包括在三层通过 DCBX/LLDP 实现的带 QoS 的 PFC,以及 ECN 和 Dynamic ECN,让 RDMA 流保持浅队列且不丢包。
DCQCN 标记
交换机标记 ECN,使端到端的 NIC 加交换机的 DCQCN 环 得以对发送端限速。ETS 和 WRED 对承载 RDMA 的队列进行整形与管理。
DLB 与 RTAG7
动态负载均衡 (包括 Reactive Path Rebalance 和 Random Flow),配合 RTAG7 哈希,分散集合通信流量并在本地拥塞时重新均衡。
与 UEC 1.0 对齐
IP Infusion 是 Ultra Ethernet 联盟的贡献成员,OcNOS-DC 与 UEC 1.0 网络配置文件对齐,因此随着 UEC 能力 NIC 上市,fabric 得以延续。对齐并不构成认证声明。
芯片选择是开放的:OcNOS-DC 运行在基于 Broadcom Tomahawk 5 的 Edgecore AIS800-64D 和 UfiSpace S9321-64E / S9321-64EO(-64EO 增加 400G ZR+)上,以及基于 Tomahawk 4 的 Edgecore AS9736-64D 上,这些都是为 RoCEv2 调优的片上共享缓冲平台。一份 IP Infusion 合同即涵盖软件和经过验证的硬件,并配以一个 TAC 和一个 SLA。
为何许多运营商在 AI 后端转向以太网
这一转变更多关乎运营与经济,而非纯粹的延迟。在大规模构建中,三点因素会迅速累积:与数据中心其余部分共享的统一网络模型、多厂商供应链,以及在 400G 和 800G 下更低的每端口成本。
其规模已在现场得到验证。Meta 曾描述在一个 24,000-GPU 集群上,通过 RoCE 以太网 fabric 训练其最大的模型——这一规模曾被认为必须依赖 InfiniBand。Tomahawk 4 和 Tomahawk 5 上的自适应负载均衡会根据实时拥塞重新绑定流量,因此在静态哈希会导致利用率受困之处,运维良好的 fabric 可将目标利用率设定在 90% 以上。90% 是设计目标,而非实测保证。
InfiniBand 仍存的优势——更低的绝对延迟下限——对一部分紧耦合 HPC 工作负载依然重要。而对大多数大规模分布式训练和推理集合通信而言,一张正确调优的 RoCEv2 fabric 的表现低于会改变作业完成时间的阈值,这正是运营与经济理由如今决定多数新建 AI 后端的原因。
- 与数据中心其余部分共享的统一网络模型,因此技能和工具得以沿用。
- 多厂商供应链,让您能为芯片、交换机、NIC 和光模块引入第二供货源。
- 在 400G 和 800G 下更低的每端口成本,为更多 GPU、更大的存储层或第二站点释放资本。
两者都成立,而多数新建 AI 后端落在以太网上
InfiniBand 保有更低的绝对延迟下限,一部分紧耦合 HPC 工作负载会一直为此买单。而对多数 AI 后端构建而言,运营与经济理由的天平倾向于基于开放以太网的 RoCEv2。
两者都成立
InfiniBand 保有更低的绝对延迟下限,一部分紧耦合 HPC 工作负载会一直为此买单。
RoCEv2 已为 AI 弥合差距
在正确配置 PFC、ECN、DCQCN 和自适应负载均衡后,以太网在多数分布式训练集合通信上已能与 InfiniBand 比肩,同时保留硬件选择自由。
决策通常取决于运营
统一的网络模型、多厂商供应链,以及在 400G 和 800G 下更低的每端口成本,决定了多数新建 AI 后端。
OcNOS-DC 是通往开放的路径
如今即拥有经过验证的 RoCEv2 原语,并为未来与 UEC 1.0 对齐,运行在来自 Edgecore 和 UfiSpace 的经过验证的开放硬件上,且在一份合同、一个 TAC 和一个 SLA 之下。
RoCE 与 InfiniBand 常见问题解答
RoCE 与 InfiniBand 有何区别?
在 AI 场景中,以太网和 InfiniBand 一样快吗?
什么是 RoCEv2?
RoCE 需要无损 fabric 吗?
我能在开放交换机上运行 RoCE 吗?
那 Ultra Ethernet 呢?
深入了解,随身带走。
产品数据手册,以及内容比本页更为深入的简明技术下载资料。
OcNOS-DC 数据手册
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
OcNOS 800G 无损 AI Fabric
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
EVPN-VXLAN 数据中心网络
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
在对比 InfiniBand 为 RoCEv2 fabric 设定规格?让我们一起做针对具体工作负载的测算
告诉我们工作负载和 GPU 规模,IP Infusion 的工程师将与您一起测算,或先在 AI Fabric Design Suite 中生成一版初步的 leaf-spine 布局。
用 OcNOS 设计整张 AI fabric
从商业论证到端口数量测算,无论您进行到哪一步,都可从此接续。