面向 AI Fabric 的 InfiniBand 与 Ethernet 对比

对于任何不简单的 GPU 集群,“直接买 InfiniBand”曾是稳妥之选,而如今这一答案正在改变。现代以太网(具备 PFC 的 RoCEv2、ECN/DCQCN、DLB,以及即将到来的 GLB 和 UEC)弥合了大部分性能差距,同时打开了超大规模云厂商正在迈入的多厂商、开放硬件之门。

InfiniBand or Ethernet for an AI cluster? InfiniBand still leads on raw latency for tightly coupled HPC, but modern Ethernet with RoCEv2 (PFC, ECN, DLB) now runs production AI fabrics at 400G and 800G, keeps your NIC, GPU, and switch choices open, and shares one operating model with the rest of the data center. OcNOS-DC delivers that Ethernet fabric today, and IP Infusion is a contributing member of the Ultra Ethernet Consortium shaping where the standard goes next.

两张网络,两种运营模式

左侧:单一厂商的 InfiniBand fabric,只有一家 IB 芯片厂商、一套交换机、一个 NIC 生态。右侧:多厂商的开放以太网 fabric,可采用任意厂商的 RoCEv2 / UEC NIC,交换芯片来自 Broadcom,以 OcNOS-DC 作为 NOS,并沿用与数据中心其余部分相同的协议。

InfiniBand 单厂商 fabric 对比多厂商以太网 fabric 两个并排的组网拓扑。左侧:单供应商 InfiniBand 组网,含两台 IB 交换机和四块 GPU,全部标注为同一家供应商。右侧:多供应商以太网组网,含两台运行 OcNOS-DC 的 leaf、两台 spine、四块配备厂商中立 RoCEv2/UEC 网卡的 GPU。底部标注对比了单供应商锁定与开放的多供应商堆栈。 InfiniBand · 单一厂商 以太网 · 开放多厂商 IB 交换机 1Quantum-class IB 交换机 2Quantum-class GPUIB NIC GPUIB NIC GPUIB NIC 单一 NIC + 交换机厂商 · 封闭生态系统 UFM / SHARP · 子网管理器 · 无多租户 Spine-1OcNOS-DC · TH5 Spine-2OcNOS-DC · TH5 GPURoCEv2/UEC GPURoCEv2/UEC GPURoCEv2/UEC 多厂商 · 开放硬件 · 标准协议 RoCEv2 · DLB · GLB · UEC · EVPN-VXLAN · gNMI 单厂商性能税 vs 开放多厂商经济性

对比情况

InfiniBand 是为低延迟、无损 RDMA 而专门打造的。二十年来,这使它在紧耦合 HPC 工作负载上拥有实实在在的性能优势。基于 DCB 协议栈、RoCEv2,以及日益成熟的 DLB 和 UEC 构建的现代以太网,在过去几年里一直在缩小这一差距。剩余的差距对某些工作负载至关重要,对另一些则无关紧要。正确答案取决于具体工作负载,而非教条之争。

Axis InfiniBand 以太网(RoCEv2 / UEC)
时延下限 端到端 NIC 到 NIC 时延极低;交换机单跳通常为数百纳秒。 时延下限比 IB 高出数百纳秒,但仍远低于会影响大规模分布式训练集合通信的阈值。
丢包容忍度 架构层面无损(基于信用的流量控制)。 通过 PFC + ECN + DCQCN 实现无损。如今已达生产级;UEC 进一步降低对 PFC 暂停的依赖。
多路径 / 负载均衡 自适应路由已内置于规范中。 静态 ECMP,外加用于自适应单跳的 DLB、用于端到端的 GLB(OcNOS 7.1),以及面向下一代的 UEC 报文喷洒。
厂商生态系统 在 NIC 和交换机芯片方面实际上均为单一供应商。 每一层均支持多厂商:ASIC、交换机、NIC、NOS、光模块。UEC 明确为厂商中立的互操作而设计。
运营模式 子网管理器(UFM 级别)。与 DC 其余部分不同。需要单独的技能与单独的工具链。 沿用您已在运行的 BGP、EVPN、gNMI。与数据中心其余部分采用相同的自动化工具(Ansible、NETCONF、OpenConfig)。
Multi-tenancy 有限;存在分区机制,但并非一流概念。 通过 EVPN-VXLAN 原生支持。GPU-as-a-Service、多团队集群、共享基础设施皆水到渠成。
长距离 DCI 并非为此设计;需要 IB-over-WAN 网关。 通过 400G ZR/ZR+ 相干可插拔模块和 EVPN 跨数据中心原生实现。
存储融合 存储与计算并行运行;需要 IB 连接的存储。 NVMe-oF、NFS、S3 全部运行在同一套以太网网络上。
每端口成本(典型 400G+) 高端;单一厂商定价。 开放硬件 spine + OcNOS-DC NOS,相比厂商锁定方案具有实质性成本优势。
路线图推进速度 受制于单一厂商的版本发布节奏。 UEC 联盟(AMD、Arista、Broadcom、Cisco、HPE、Intel、Meta、Microsoft、Oracle 等)推动着公开发布的规范演进。

各自的制胜场景

何时选择 InfiniBand

时延下限受合同约束

在 HPC 仿真负载中,每一次集合通信都至关重要,绝对时延下限比总拥有成本更为关键。适用于紧凑、专属的单租户集群,在这类场景中厂商锁定是可以接受的。

在以下情况选择以太网

运维模式至关重要

多租户 GPU 即服务。与数据中心其余部分共享基础设施的 AI 集群。凡是团队希望采用统一运维模型、统一工具栈和多厂商供应链的场景,均适用。

在以下情况选择以太网

每 GPU 浮点运算成本是关键门槛

开放硬件 spine + OcNOS-DC 消除了专有网络税。在数千 GPU 规模的集群上,所节省的 CapEx 往往足以购买额外的 GPU 算力。

在以下情况选择以太网

该 fabric 可跨多个 DC 延伸

如果某次训练任务有朝一日需要跨越两个机房或两个地域,以太网将成为默认优选:相干 DCI、EVPN 数据中心间互联以及标准的多厂商光模块,使这成为一天即可完成的工作,而非耗时一个季度的线路系统工程。

现代以太网已弥合差距的领域

无损行为。 采用 PFC、DCQCN 的 RoCEv2,以及 OcNOS-DC PFC 死锁看门狗 如今已达生产级水平。一旦正确配置好这些机制,“以太网会丢包”这一质疑便不再成立。

自适应路由。 AI 工作负载上的静态 ECMP 冲突确实存在,但 DLB 在亚毫秒级时间窗口内根据本地拥塞重新分配 flowlet,并 GLB 在 OcNOS 7.1 中将其扩展为完整的端到端路径评分。

适配喷洒式传输。 Ultra Ethernet(UEC) 为标准以太网带来包喷洒(packet spray)、多路径 RDMA、乱序交付以及选择性重传。曾定义 InfiniBand 的架构优势,正落地于多厂商的开放协议栈之上。

TCO 探讨

For most production AI fabric decisions in 2026, the network is 5-8% of cluster TCO over five years. The InfiniBand premium typically lands in the +30% to +60% range over open-hardware Ethernet for equivalent capacity. On a $100M cluster, that's a meaningful number, but the more important number is what you can do with the saved capex (more GPUs, larger storage tier, second site for HA). And for clusters where the network is multi-tenant or shared with the rest of DC, the operational simplification of one network model is worth more than its line-item cost difference.

IP Infusion 的观点

  • 两者各有用武之地。 我们不会假装以太网能在每种工作负载中都胜出。对延迟有绝对下限要求的紧耦合 HPC 集群,在一段时间内仍会继续选购 InfiniBand。
  • 大多数 AI 网络都应构建在以太网之上。 超大规模的生产级 AI 训练与推理正在转向以太网,因为一旦技术差距缩小,其运维和经济上的优势便压倒性地明显,而这一差距正在快速缩小。
  • OcNOS-DC 是开放之路。 当前支持 RoCEv2,当前支持 DLB,下一步支持 GLB,并将随网卡上市支持 UEC。一套 NOS、一份特性路线图,运行于来自 Edgecore、UfiSpace、Wedge 等厂商的经过验证的开放硬件之上。
  • 架构评审免费提供。 如果您正在进行 fabric 容量规划,并希望获得针对具体工作负载的分析而非厂商推销,我们的网络架构师将与您一同完成计算;或者,您也可以从以下工具的 leaf-spine 初步布局入手 AI Fabric 定量工具.

为下一个集群选择 IB 还是以太网?让我们做一次针对具体工作负载的测算。

预约架构评审 →
常见问题

常见问题

与 InfiniBand 相比,Ethernet 对于 AI 训练是否足够快?
对于大规模的多数分布式训练集合通信而言,是的。Ethernet的时延下限比InfiniBand高出数百纳秒,但只要正确配置了具备PFC、DCQCN和DLB的RoCEv2,这一差异便低于影响多数工作负载的阈值。
在哪些情况下仍应选择 InfiniBand?
对于绝对时延下限比total cost of ownership更重要的紧耦合HPC仿真,以及可接受single-vendor lock-in的封闭式单租户集群,请选择InfiniBand。
在 AI fabric 中,Ethernet 何时更具优势?
在多租户 GPU-as-a-Service、与 data center 其余部分共享同一运维模型和工具的集群、对成本敏感的数千 GPU 规模建设,以及通过 coherent DCI 和 EVPN 跨 data center 延伸的 fabric 等场景中,Ethernet 更胜一筹。
OcNOS 如何缩小与 InfiniBand 的差距?
OcNOS-DC 当前提供 RoCEv2 lossless 传输、DLB 自适应路由以及 PFC 死锁看门狗,在 7.1 中提供用于端到端路径评分的 GLB,并随 NIC 上市提供 UEC 支持,全部运行在 Edgecore、UfiSpace 等厂商的已验证 open hardware 之上。
Are hyperscalers replacing InfiniBand with Ethernet for AI?
Yes. Ethernet passed InfiniBand in AI back-end networking during 2025, and industry reporting in early 2026 put roughly 70 percent of new AI fabric deployments on Ethernet. Meta has described training its largest models over a RoCE Ethernet fabric on a 24,000-GPU cluster. The Ultra Ethernet Consortium, whose founding members include AMD, Arista, Broadcom, Cisco, Eviden, HPE, Intel, Meta and Microsoft, was formed to standardize this direction. The reasons are operational and economic: one network model shared with the rest of the data center, a multi-vendor supply chain, and lower cost per port at 400G and 800G.
What is the best alternative to InfiniBand for AI cluster networking?
Ethernet with RoCEv2 is the mainstream alternative. It carries RDMA losslessly using PFC, ECN and DCQCN, adds adaptive routing through DLB, and gains packet spray and multi-path RDMA through Ultra Ethernet as UEC NICs ship. On open hardware running OcNOS-DC, it delivers this on a multi-vendor stack rather than a single-vendor fabric.
What is the difference between Ultra Ethernet and InfiniBand?
Ultra Ethernet (UEC) brings the transport techniques that defined InfiniBand to standard Ethernet: packet spray across all paths, multi-path RDMA, out-of-order delivery, and selective retransmission. The UEC 1.0 specification, published in 2025, defines this transport. The difference is the ecosystem: InfiniBand is effectively single-vendor for NIC and switch silicon, while Ultra Ethernet is an open, multi-vendor specification any vendor can build to.
How much does an Ethernet AI fabric cost compared to InfiniBand?
The network is roughly 5 to 8 percent of AI cluster total cost of ownership over five years, so it is rarely the largest line item. For equivalent capacity, single-vendor InfiniBand generally carries a price premium over open-hardware Ethernet running OcNOS-DC. The more important number is what the saved capital funds, whether that is more GPUs, a larger storage tier, or a second site for resilience.