RoCEv2 · DLB · Ultra Ethernet

面向 AI Fabric 的 InfiniBand 与 Ethernet 对比

对多数 AI fabric 而言,选以太网;对延迟敏感的 HPC,则选 InfiniBand。 如今,采用 RoCEv2 的现代以太网已能在开放的多厂商硬件上以 400G 和 800G 运行生产级 fabric,OcNOS-DC 现已交付这一能力。本指南阐述两者各自仍然适用的场景。

Two-thirds以太网份额、AI 横向扩展
最高 800G生产级 RoCEv2 fabric
1 NOS运行于开放硬件上的 OcNOS-DC
600+基于 OcNOS 的运营商网络
两种 fabric,两套运营模式

同样的 GPU,两张截然不同的网络

左侧是单一厂商的 InfiniBand fabric:一家芯片厂商、一条交换机产品线、一套 NIC 生态,以及一个独立于数据中心其余部分的子网管理器。右侧是多厂商的开放以太网 fabric:来自任意厂商的 RoCEv2 或 UEC NIC、Broadcom 交换芯片、作为 NOS 的 OcNOS-DC,以及您已在运行的同一套协议。

InfiniBand 单厂商 fabric 对比多厂商以太网 fabric Two side-by-side fabric topologies. Left: a single-vendor InfiniBand fabric with two IB switches and three GPUs. Right: a multi-vendor Ethernet fabric with two OcNOS-DC spines and three GPUs with RoCEv2 or UEC NICs. Bottom labels contrast a single-vendor stack with an open multi-vendor stack. INFINIBAND · SINGLE-VENDOR ETHERNET · OPEN MULTI-VENDOR IB 交换机 1Quantum-class IB 交换机 2Quantum-class GPUIB NIC GPUIB NIC GPUIB NIC SINGLE NIC + SWITCH VENDOR SUBNET MANAGER · LIMITED MULTI-TENANCY Spine-1OcNOS-DC · TH5 Spine-2OcNOS-DC · TH5 GPURoCEv2/UEC GPURoCEv2/UEC GPURoCEv2/UEC MULTI-VENDOR · OPEN HARDWARE RoCEv2 · DLB · GLB · UEC · EVPN-VXLAN · gNMI SINGLE-VENDOR STACK vs OPEN MULTI-VENDOR STACK
对比情况

InfiniBand 与以太网,逐项对比

InfiniBand 专为低延迟、无损 RDMA 而生,二十年来在紧耦合 HPC 上确有真正的优势。而基于 DCB 协议栈、RoCEv2,以及日益成熟的 DLB 和 UEC 构建的现代以太网,近几年一直在缩小这一差距。哪些差距仍然重要,取决于具体工作负载。

Axis InfiniBandsingle-vendor EthernetRoCEv2 / UEC,开放
时延下限端到端 NIC 到 NIC 时延极低;交换机单跳通常为数百纳秒。时延下限比 IB 高出数百纳秒,但仍远低于会影响大规模分布式训练集合通信的阈值。
丢包容忍度架构层面无损(基于信用的流量控制)。通过 PFC + ECN + DCQCN 实现无损。如今已达生产级;UEC 进一步降低对 PFC 暂停的依赖。
多路径 / 负载均衡自适应路由已内置于规范中。静态 ECMP,外加用于自适应单跳的 DLB、用于端到端的 GLB(OcNOS 7.1),以及面向下一代的 UEC 报文喷洒。
厂商生态系统在 NIC 和交换机芯片方面实际上均为单一供应商。每一层均支持多厂商:ASIC、交换机、NIC、NOS、光模块。UEC 明确为厂商中立的互操作而设计。
运营模式子网管理器(UFM 级别)。与 DC 其余部分不同。需要单独的技能与单独的工具链。沿用您已在运行的 BGP、EVPN、gNMI。与数据中心其余部分采用相同的自动化工具(Ansible、NETCONF、OpenConfig)。
Multi-tenancy有限;存在分区机制,但并非一流概念。通过 EVPN-VXLAN 原生支持。GPU-as-a-Service、多团队集群、共享基础设施皆水到渠成。
长距离 DCI并非为此设计;需要 IB-over-WAN 网关。通过 400G ZR/ZR+ 相干可插拔模块和 EVPN 跨数据中心原生实现。
存储融合存储与计算并行运行;需要 IB 连接的存储。NVMe-oF、NFS、S3 全部运行在同一套以太网网络上。
每端口成本(典型 400G+)高端;单一厂商定价。开放硬件 spine + OcNOS-DC NOS,相比厂商锁定方案具有实质性成本优势。
路线图推进速度受制于单一厂商的版本发布节奏。UEC 联盟(AMD、Arista、Broadcom、Cisco、HPE、Intel、Meta、Microsoft、Oracle)推动着公开发布的规范演进。
选型决策

各自的制胜场景

正确答案因工作负载而异。当绝对延迟下限是硬性要求时,选 InfiniBand;当运营模式、成本或跨站点覆盖决定成败时,选以太网。

何时选择 InfiniBand

延迟下限写进了合同

在绝对延迟下限比总拥有成本更重要的 HPC 仿真场景,以及可以接受锁定的紧凑、封闭式单租户集群中。

在以下情况选择以太网

运营模式才是关键

多租户 GPU 即服务,以及与数据中心其余部分共享基础设施的集群——在这些场景中,统一的运营模式、统一的工具链和多厂商供应链会胜出。

在以下情况选择以太网

每 GPU-flop 成本是决定门槛

搭载 OcNOS-DC 的开放硬件主干消除了单一厂商的网络溢价。在数千 GPU 规模的集群上,这在硬件预算中占据可观的份额。

在以下情况选择以太网

fabric 需要跨越多个数据中心

只要一次训练作业有可能跨越两个机房或两个区域,相干 DCI、EVPN 跨数据中心互联和标准的多厂商光模块就能把它变成一天就能解决的问题,而非长达一个季度的线路系统工程。

差距缩小之处

现代以太网新增了什么

三项进展把生产级 AI fabric 推向了以太网:真正的无损行为、让流量避开拥塞上行链路的自适应路由,以及适合喷洒的下一代传输。

无损行为

RoCEv2 with PFC、DCQCN 以及 PFC 死锁看门狗 交付 AI 集合通信所需的无损 RDMA 传输,如今已在标准以太网上达到生产级水平。

自适应路由

AI 工作负载上的静态 ECMP 冲突确实存在,但 DLB 在亚毫秒级窗口内根据本地拥塞对 flowlet 重新分箱,OcNOS 7.1 中的 GLB 进一步将其扩展到端到端路径评分。

适合喷洒的传输

Ultra Ethernet(UEC 1.0,2025 年 6 月)为标准以太网带来 数据包喷洒、多路径 RDMA 和乱序交付 。现在即可基于 RoCEv2 构建,并在 NIC 上市时保留通往 UEC 的顺畅路径。

TCO 探讨

网络只是一小笔开支,因此对比的重点应放在它所释放的价值上

在五年周期内,交换层仅占集群 TCO 的个位数百分比,计入 NIC、光模块和布线后会有所上升。真正有意义的问题不是这笔开支本身,而是省下的资本能用来做什么。

  • 在同等容量下,单一厂商的 InfiniBand 相比开放硬件以太网存在价格溢价。
  • 省下的资本可用于购置更多 GPU、更大的存储层,或建设用于冗余的第二站点。
  • 当 fabric 属于多租户或与数据中心其余部分共享时,统一的网络模型所带来的价值超过那点开支差异。
IP Infusion 的观点

两者各有其位,而多数 AI fabric 归属以太网

以太网并非在每种工作负载上都胜出,但对多数场景而言,其运营与经济上的理由具有决定性,且随着技术差距缩小而愈发有力。

两者各有其位

以太网并非在每种工作负载上都胜出。对绝对延迟下限有要求的紧耦合 HPC 集群,仍然更青睐 InfiniBand。

多数 AI fabric 归属以太网

随着运营与经济理由日益充分、技术差距持续缩小,超大规模的生产级 AI 训练与推理正在转向以太网。

OcNOS-DC 是通往开放的路径

当前支持 RoCEv2,当前支持 DLB,下一步支持 GLB,并将随网卡上市支持 UEC。一套 NOS、一份特性路线图,运行于来自 Edgecore、UfiSpace 等厂商的经过验证的开放硬件之上。

常见问题

InfiniBand 与以太网,答案在此

与 InfiniBand 相比,Ethernet 对于 AI 训练是否足够快?
对于大规模的多数分布式训练集合通信而言,是的。Ethernet的时延下限比InfiniBand高出数百纳秒,但只要正确配置了具备PFC、DCQCN和DLB的RoCEv2,这一差异便低于影响多数工作负载的阈值。
在哪些情况下仍应选择 InfiniBand?
对于绝对时延下限比total cost of ownership更重要的紧耦合HPC仿真,以及可接受single-vendor lock-in的封闭式单租户集群,请选择InfiniBand。
在 AI fabric 中,Ethernet 何时更具优势?
在多租户 GPU-as-a-Service、与 data center 其余部分共享同一运维模型和工具的集群、对成本敏感的数千 GPU 规模建设,以及通过 coherent DCI 和 EVPN 跨 data center 延伸的 fabric 等场景中,Ethernet 更胜一筹。
OcNOS 如何缩小与 InfiniBand 的差距?
OcNOS-DC 当前提供 RoCEv2 lossless 传输、DLB 自适应路由以及 PFC 死锁看门狗,在 7.1 中提供用于端到端路径评分的 GLB,并随 NIC 上市提供 UEC 支持,全部运行在 Edgecore、UfiSpace 等厂商的已验证 open hardware 之上。
超大规模厂商是否正在用以太网取代 InfiniBand 来做 AI?
大体如此,不过 InfiniBand 并不会消失。据 Dell'Oro Group 数据,在 AI 后端(横向扩展)交换领域,以太网已超越 InfiniBand,到 2026 年初约占市场三分之二,而 2023 年底 InfiniBand 曾占据约 80% 的份额。Dell'Oro 还指出,随着 NVIDIA Blackwell Ultra 800G 放量,InfiniBand 出现强劲反弹,因此它仍是紧耦合 HPC 的专用之选。Meta 曾表示,其最大的模型是在两个 24,576-GPU 集群之一上,通过 RoCE 以太网 fabric 完成训练的。指导委员会成员包括 AMD、Arista、Broadcom、Cisco、Eviden、HPE、Intel、Meta、Microsoft 和 Oracle 的 Ultra Ethernet 联盟正在标准化这一方向。原因在于运营与经济:与数据中心其余部分共享的统一网络模型、多厂商供应链,以及在 400G 和 800G 下更低的每端口成本。
AI 集群组网中,InfiniBand 的最佳替代方案是什么?
采用 RoCEv2 的以太网是主流替代方案。它借助 PFC、ECN 和 DCQCN 无损地承载 RDMA,通过 DLB 加入自适应路由,并随着 UEC NIC 上市,通过 Ultra Ethernet 获得数据包喷洒和多路径 RDMA。在运行 OcNOS-DC 的开放硬件上,它以多厂商栈而非单一厂商 fabric 交付这一切。
Ultra Ethernet 与 InfiniBand 有何区别?
Ultra Ethernet(UEC)把曾经定义 InfiniBand 的传输技术带到了标准以太网上:跨所有路径的数据包喷洒、多路径 RDMA、乱序交付和选择性重传。2025 年 6 月发布的 UEC 1.0 规范定义了这一传输。区别在于生态:InfiniBand 在 NIC 与交换芯片上实际是单一厂商,而 Ultra Ethernet 是一套开放的多厂商规范,任何厂商都可据以构建。
以太网 AI fabric 相比 InfiniBand 成本如何?
交换层在 AI 集群总拥有成本中占比不高,五年周期内通常为个位数百分比,不过计入 NIC、光模块和布线后这一数字会上升。在同等容量下,单一厂商 InfiniBand 通常相比运行 OcNOS-DC 的开放硬件以太网存在价格溢价。更有意义的问题是省下的资本能做什么——是更多 GPU、更大的存储层,还是用于冗余的第二站点。

在规划下一个集群?获取针对具体工作负载的评审

告诉我们工作负载和 GPU 规模,IP Infusion 的工程师将与您一起测算,或先在 AI Fabric Design Suite 中生成一版初步的 leaf-spine 布局。