网络定义 · RDMA · RoCEv2

什么是 AI Fabric?

AI fabric 是在分布式训练和推理期间承载 GPU 之间 RDMA 流量的 GPU 后端(scale-out)网络。 It connects every GPU NIC across servers and pods using leaf and spine switches in rail-optimized and Clos topologies, and it runs a lossless Ethernet transport (RoCEv2 with PFC and ECN) so no packet is dropped under load. Because GPUs exchange data in lockstep collectives, the fabric's tail latency sets job completion time. This is the networking sense, not the enterprise "data fabric" used in data management. OcNOS-DC provides this fabric on Broadcom Tomahawk 5 hardware.

RoCEv2无损以太网传输
51.2 TbpsTomahawk 5,64x800G
16,000+GPU,三级 Clos
OcNOS-DC开放硬件上的一套 NOS
一词两义

网络意义上的概念,而非“数据 fabric”

两个不同领域都在使用“fabric”这个词。数据 fabric 是一种用于在企业范围内统一和治理数据的软件架构。而本页所讨论的 AI fabric,则是一张物理网络:在 GPU 之间搬移 RDMA 流量的线缆、交换机和传输。当 AI 基础设施团队说“fabric 是瓶颈”时,他们指的正是这张网络——那张决定了训练运行耗时多久的网络。

  • 数据 fabric。 一种用于在各系统间统一和治理数据的企业级数据管理架构。是软件,而非线缆。
  • AI fabric. 在训练和推理期间承载 GPU 之间 RDMA 的物理 GPU 后端网络。本页讨论的正是这一含义。
  • 为何重要。 AI fabric 是决定作业完成时间的那一个,因此它被精心设计以保持无损且负载均匀。
fabric 如何构建

Rail、Clos,以及一种不允许丢包的传输

AI fabric 是一张为单一流量模式调优的 leaf-spine(Clos)网络:众多 GPU 同时相互发送大流量。三项设计选择定义了它,而每一项都是为保护作业完成时间而存在。

拓扑

先 rail 优化,再三级 Clos

Each of a GPU server's 8 NICs connects to its own 专用 rail leaf,因此占主导的同 rail AllReduce 流量留在一台 leaf 上。超出单个 pod 后,该设计扩展为由 leaf、spine 和 super-spine 组成的三级 Clos。

Transport

无损 RoCEv2

GPU 用 RDMA 搬移数据,而 RDMA 在数据包被丢弃时表现很差。 PFC 阻止交换机队列溢出,而 ECN 提前标记数据包,使发送端 NIC 在丢包发生之前就减速。这种组合让 RoCEv2 在以太网上运行。

Behaviour

为何它必须无损

OcNOS-DC 交付这张 fabric,配以 PFC(包括三层)、ECN、Dynamic ECN、WRED,以及动态负载均衡,让每条路径均匀负载,因为尾部的那条流决定了整个作业何时完成。

它的适用之处

以太网已足够,而交换机决定上限

如今 AI fabric 是一张以太网网络。它能达到的规模由其底层的交换芯片以及您所设计的 GPU 数量决定。

  • 以太网已足够。 带 PFC 和 ECN 的 RoCEv2 在标准的多厂商硬件上交付无损 RDMA。Meta 已公布一个基于以太网构建的 24,000-GPU 训练集群。
  • 交换机决定上限。 OcNOS-DC 运行在 Broadcom Tomahawk 5(51.2 Tbps,64x800G)平台上,例如 Edgecore AIS800-64D 和 UfiSpace S9321-64E,这正是 800G GPU fabric 所需的密度。
  • 按 GPU 数量设计。 Rail-optimized single pod up to roughly 1,000 GPUs, then a 3-stage Clos to 16,000+ and up to about 65,536 at the fat-tree limit.
常见问题

什么是 AI Fabric 常见问题解答

什么是AI组网?
在网络领域,AI fabric 是在分布式训练和推理期间承载 GPU 之间 RDMA 流量的 GPU 后端(scale-out)网络。它把每台服务器和每个 pod 上的 GPU NIC 连接起来,使 AllReduce 等集合操作以最慢链路所允许的速度完成。它由 rail 优化和 Clos 拓扑中的 leaf 与 spine 交换机构建,并运行一种无损以太网传输(带 PFC 和 ECN 的 RoCEv2)。OcNOS-DC 在 Broadcom Tomahawk 5 硬件上提供这种 fabric。
AI fabric 和数据 fabric 是一回事吗?
不是。它们是共用一个词的不同术语。数据 fabric 是一种用于在各系统间统一和治理数据的企业级数据管理架构。而这里所用网络意义上的 AI fabric,则是一张在 GPU 之间搬移 RDMA 流量的物理 GPU 后端网络。本页讨论的是其网络含义。
为何 AI fabric 决定作业完成时间?
GPU 训练是步调一致地进行的。每一步之后,GPU 会在一次集合通信中交换梯度,每个 GPU 都要等这次交换完成后,下一步才开始。若某条链路停滞或丢包,整个作业都要等待。由于 fabric 承载着每一次这样的交换,因此决定一次训练运行耗时的是它的尾延迟,而非平均值——这正是 fabric 被精心设计以保持无损且负载均匀的原因。
AI fabric 需要 InfiniBand,还是以太网就够了?
如今以太网已是一流的 AI fabric 传输。带 PFC 和 ECN 的 RoCEv2 在标准的多厂商硬件上交付无损 RDMA,Meta 也已公布一个基于以太网构建的 24,000-GPU 训练集群。OcNOS-DC 如今即运行这张 RoCEv2 fabric,并为下一代端点与 Ultra Ethernet 联盟 1.0 fabric profile 对齐。

在构建 AI fabric?让我们一起来设定规格。

告诉我们 GPU 规模和工作负载,IP Infusion 的工程师将在运行 OcNOS-DC 的开放 Tomahawk 5 硬件上,与您一起进行拓扑和端口测算。