网络定义 · Scale-out · RoCEv2

什么是 GPU Fabric?

GPU fabric 是把跨服务器和跨 pod 的 GPU 互连起来的后端网络,使它们能够协同完成一项训练或推理作业。 它承载 GPU 在集合操作期间交换的 RDMA 流量,独立于用于管理和存储的前端网络。它是一张 scale-out 网络,从服务器内的 scale-up 域(例如 NVLink)结束之处开始,由运行无损 RoCEv2 的 rail 优化和 Clos 拓扑构建,OcNOS-DC 在 Broadcom Tomahawk 5 硬件上提供它。

~2,048 GPUs两级,1:1 无阻塞
16,000+ 个 GPU三级 Clos 规模
51.2 TbpsTomahawk 5 · 64x800G
1 NOS运行于开放硬件上的 OcNOS-DC
fabric 从哪里开始

scale-up 结束,scale-out 开始

GPU fabric 位于一条清晰边界的一侧。在服务器内部,scale-up 域以太比特速率运行;在服务器之间,scale-out GPU fabric 承载其余部分。一次集合通信先在域内使用 scale-up,然后由这张 fabric 承载跨服务器流量。

服务器内部

scale-up 域

GPU 服务器及其紧耦合域内部的超高带宽互连,例如 NVL72 机架内的 NVLink. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.

服务器之间

scale-out GPU fabric

服务器与 pod 之间跨越以下层级的以太网网络: rail、leaf、spine 和 Clos 各层. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.

fabric 的形态

Rail 与 Clos

多数 GPU fabric 是 rail 优化的 leaf-spine 网络:GPU 服务器的 8 块 NIC 各自连接到专用的 rail leaf,因此占主导的同 rail AllReduce 流量留在一台 leaf 上,绝不穿越 spine。超出单个 pod 后,该设计扩展为带 super-spine 层的三级 Clos。

rail 优化 leaf

服务器的每 8 NICs 映射到各自的 rail leaf,让占主导的同 rail AllReduce 流量留在一台 leaf 上、避开 spine。

三级 Clos 规模

在基数为 64 的 Tomahawk 5 上,两级 fabric 约达 2,048 GPUs ,为 1:1 无阻塞;三级 Clos 可扩展到 16,000+ 个 GPU.

无损 RoCEv2 传输

GPU 平面通过以下方式承载 RDMA: RoCEv2,经精心设计以实现无损,使集合通信绝不因丢包而停滞。

在 GPU 平面上

无损 RoCEv2,由 OcNOS-DC 交付

GPU 通过基于 RoCEv2 的 RDMA 搬移数据,而 RDMA 在丢包下表现很差。因此 GPU fabric 被精心设计为无损并保持负载均匀,使集合通信期间没有链路成为热点。OcNOS-DC 在 Broadcom Tomahawk 5 上正是提供了这一点,作为开放、多厂商硬件的使能者。

  • 通过优先级流控(包括三层)和 ECN 精心设计为无损,使一个训练步骤绝不因丢包而停滞。
  • 通过 Dynamic ECN 和 DLB 保持负载均匀,使集合通信期间没有单条链路成为热点。
  • 由 OcNOS-DC 在 Broadcom Tomahawk 5(51.2 Tbps,64x800G)平台上交付,例如 Edgecore AIS800-64D 和 UfiSpace S9321-64E。
常见问题

什么是 GPU Fabric 常见问题解答

什么是GPU组网?
GPU fabric 是把跨服务器和跨 pod 的 GPU 互连起来的后端网络,使它们能协同完成一项训练或推理作业。它承载 GPU 在集合操作期间交换的 RDMA 流量,并独立于用于管理和存储的前端网络。实践中,GPU fabric 是一张 leaf-spine(Clos)以太网网络,通常经过 rail 优化,运行无损 RoCEv2。OcNOS-DC 在 Broadcom Tomahawk 5 硬件上提供它。
scale-up 和 scale-out 有何区别?
scale-up 是 GPU 服务器及其紧耦合域内部的超高带宽互连,例如 NVL72 机架内的 NVLink,GPU 在其中以太比特速率通信,仿佛构成一个大型加速器。scale-out 则是服务器与 pod 之间的网络,即本页所述的 GPU fabric,由以太网上的 rail、leaf、spine 和 Clos 各层构建。一次集合通信先在域内使用 scale-up,然后由 scale-out GPU fabric 在服务器之间承载其余部分。
GPU fabric 采用什么拓扑?
Most GPU fabrics use a rail-optimized leaf-spine design: each of a GPU server's 8 NICs connects to its own dedicated rail leaf, so the dominant same-rail AllReduce traffic stays on one leaf. As the cluster grows past a single pod, the design extends to a 3-stage Clos with a super-spine tier. 在基数为 64 的 Tomahawk 5 上,两级 fabric 约达 2,048 GPUs at 1:1 non-blocking and a 3-stage Clos scales to 16,000+ GPUs. See the rail-optimized network and AI fabric topologies pages.
GPU fabric 必须无损吗?
是的,在 GPU 平面上如此。GPU 通过基于 RoCEv2 的 RDMA 搬移数据,而 RDMA 在丢包下表现很差,因此 GPU fabric 通过优先级流控和 ECN 被精心设计为无损,并通过动态负载均衡保持负载均匀。正是这种不丢包的行为让集合通信不致停滞。OcNOS-DC 在 Broadcom Tomahawk 5 上正是为此提供 PFC、ECN、Dynamic ECN 和 DLB。

在搭建 GPU fabric?让我们一起为该平面设定规格。

告诉我们 GPU 数量和工作负载,IP Infusion 的工程师将与您一起做端口测算,或先在 AI Fabric Design Suite 中从一版初步的 rail 优化布局开始。