网络定义 · 800G · RoCEv2

什么是 AI 网络交换机?

AI 网络交换机是一种高端口基数(high-radix)的数据中心以太网交换机,每端口速率通常为 400G 或 800G,用于在 AI 后端 fabric 中连接 GPU 服务器,并借助 PFC、ECN 和自适应负载均衡保持 RDMA 流量无损,因为最慢的数据流决定了训练作业的耗时。 IP Infusion 开发运行这类交换机的网络操作系统 OcNOS-DC,并在 51.2 Tbps Broadcom Tomahawk 5 以及 25.6 Tbps 和 12.8 Tbps 平台上以经过验证的完整系统形式交付。

51.2 TbpsTomahawk 5 平台
800G每台交换机 64 个端口
RoCEv2无损以太网传输
40+验证平台
定义

数据中心交换机成为 AI 交换机的条件

当交换机能够以训练集群所需的速率、规模和丢包率承载 GPU 流量时,才称得上 AI 交换机。它由五项特性区分开来。这些交换机所构成的网络请参阅 什么是 AI fabric;本页介绍的是交换机本身。

  • 端口速率与容量。 GPU NIC 以 400G 和 800G 接入,交换机端口必须与之匹配。51.2 Tbps 交换机提供 64 个 800G 端口;25.6 Tbps 交换机提供 64 个 400G 端口。
  • 端口基数(Radix)。 每台交换机的端口数决定一个 leaf 能服务多少 GPU、一个 spine 能连接多少 leaf,进而决定 fabric 需要多少层。层级越少,跳数、光模块和功耗就越少。
  • 无损传输。 GPU 之间通过融合以太网上的 RDMA(RoCEv2)交换数据,一旦丢包,性能会急剧下降。交换机需要优先级流量控制(PFC)在队列溢出前暂停该队列,并需要显式拥塞通知(ECN)尽早提醒发送方,与 NIC 上的 DCQCN 拥塞控制协同工作。
  • 负载均匀。 AllReduce 等集合通信操作会产生少量非常大的数据流。静态哈希可能将其中两条放到同一链路上,而另一条链路却处于空闲。 动态负载均衡 将流量转移到负载较低的路径。
  • 可视性。 流式遥测 实时报告队列深度、PFC 暂停和 ECN 标记,使运维人员能够找到拖慢作业的那条链路。
部署位置

AI 交换机在 AI 网络 fabric 中的位置

AI 数据中心同时运行四张网络,每张网络对交换机的要求各不相同。大多数人所说的 AI 交换机,指的是 GPU 后端 fabric 中的交换机。

GPU 后端 fabric

连接各服务器上的 GPU NIC,用于训练和推理。采用 rail 优化的 leaf 与 Clos spine ,速率为 400G 或 800G,端到端无损运行。端口速率和端口基数在这里最为关键。

存储 fabric

为 GPU 服务器提供训练数据并回写检查点。通常也采用 RoCEv2 ,按持续带宽而非 GPU 数量进行规划。

前端网络

将集群连接到用户、编排系统和数据中心的其余部分。通常是常规的 leaf-spine,并常借助 EVPN-VXLAN 在 GPU 云中隔离租户。

带外管理

独立的 1G 网络 ,用于控制台、服务器管理控制器和交换机管理,使运维人员在数据平面繁忙或中断时仍能访问每台设备。

在后端 fabric 内部,同一型号的交换机可以用作 rail leaf、spine 或 super-spine。rail 优化设计将服务器中的每块 GPU NIC 连接到不同的 leaf,使同序号 GPU 之间的流量只相隔一跳。拓扑决定角色; AI fabric 拓扑 和 rail 优化网络 介绍了这些设计。

AI 交换机的采购方包括 neocloud 和 GPU 云服务商、大型企业数据中心和 MSP,以及在自有数据中心中增加 GPU 容量的服务提供商。

规模规划

800G 还是 400G:按端口基数规划 AI 交换机

交换机的端口数决定 fabric 在需要增加一层之前能扩展到多大。在无阻塞的两层 leaf-spine 中,每个 leaf 将端口平均分配给 GPU 和 spine,每个 spine 端口连接一个 leaf。因此,一台拥有 k 个端口的交换机在两层中可支持 k 的平方除以二个端点,在三层中可支持 k 的立方除以四个端点。

交换容量全速率端口数两层,无阻塞三层,无阻塞
51.2 Tbps64 个 800G2,048 个 800G 端点65,536 个 800G 端点
25.6 Tbps64 个 400G2,048 个 400G 端点65,536 个 400G 端点
12.8 Tbps32 个 400G512 个 400G 端点8,192 个 400G 端点
  • 这些是算术上限, 而非产品规模数据。实际设计会受到超额订阅、每台服务器的 rail 数、光模块传输距离和机架功率的影响。
  • 在相同端口基数下,800G 可在不增加层级的情况下使每个 GPU 的带宽翻倍。这就是围绕 800G NIC 构建的后端 fabric 采用 51.2 Tbps 交换机的原因。
  • IP Infusion 参考设计 适用于 rail 优化和三级 Clos fabric,按实际端口数量规划,详见 AI fabric 拓扑。设计之间如何取舍,请参阅 如何选择 AI 网络 fabric.
OcNOS 平台

经 OcNOS-DC 验证的 AI 数据中心交换机

OcNOS-DC 是 IP Infusion 面向数据中心和 AI fabric 的网络操作系统。它运行于基于 Broadcom 芯片的开放交换机,下列每个平台均列于 OcNOS 硬件兼容性列表,该列表共涵盖 40+ 个经过验证的平台。

容量Broadcom ASIC经过验证的平台在 AI 数据中心中的典型位置
51.2 TbpsTomahawk 5 (BCM78900)Edgecore AIS800-64D、UfiSpace S9321-64E、UfiSpace S9321-64EO800G 后端 leaf 和 spine;S9321-64EO 还可承载 相干 DCI ,用于站点之间互联
25.6 TbpsTomahawk 4 (BCM56990)Edgecore AS9736-64D(DCS520)400G 后端 fabric、存储网络或前端网络
12.8 TbpsTomahawk 3 (BCM56980)Edgecore AS9716-32D(DCS510)面向较小规模 fabric 和前端网络的 400G spine
12.8 TbpsTrident 4 (BCM56880)Edgecore AS9726-32DB(DCS240),UfiSpace S9300-32D面向前端和存储网络的 400G leaf;支持 IPoDWDM

OcNOS-DC 为交换机带来的能力

  • 无损 RoCEv2: PFC(包括基于三层路由 underlay 的 PFC)、 PFC 死锁检测与恢复、支持 DCQCN 调优的 ECN,以及用于按流量类别分配带宽的 DCBX 和 ETS。
  • 负载均衡: 用于感知 flowlet 的自适应路由的动态负载均衡(DLB),以及 全局负载均衡(GLB) ,用于 OcNOS 7.1 中的全 fabric 路径优化。
  • 多租户 GPU 云: EVPN-VXLAN 在共享 fabric 上隔离租户。在 Trident 3 X4、X5、X7 和 Trident 4 平台上,基于 VXLAN 的 ECN 和 PFC 还可在 overlay 中传递拥塞信号。
  • 运维: 基于 gNMI 和 OpenConfig 的流式遥测,以及 NETCONF、YANG 和零接触部署.
  • 许可与平台支持: DLB、PFC 死锁检测与恢复以及基于 VXLAN 的 ECN 属于 OcNOS-DC PLUS 层级功能,支持情况因平台而异。 OcNOS 功能矩阵 按平台和层级列出 700+ 项功能。
  • 管理网络: 1G Trident 3 X2 平台(Edgecore AS4625-54T、Celestica DS1000 和 UfiSpace S6301-56ST,每款 120 Gbps)以同一 NOS 运行带外网络。
优势与取舍

开放 AI 交换机带来什么,又要求什么

采用独立网络操作系统的开放交换机,改变了选择权和工作量各自所在的位置。

您将获得

  • 硬件选择。 OcNOS-DC 运行于多家硬件制造商的交换机,因此每个平面都可以按容量、光模块和交付周期进行选择。
  • 跨平面统一 NOS。 后端、存储、前端和管理网络运行同一个操作系统、同一套 CLI 和同一种自动化模型。
  • 标准以太网。 RoCEv2 fabric 使用与数据中心其余部分相同的光模块、布线和工具,GPU NIC 可以独立于交换机进行选择。
  • 通往新芯片的路径。 从 25.6 Tbps 升级到 51.2 Tbps 更换的是交换机,而不是运维模式。

提出的要求

  • 集成。 只有当交换机缓冲区、PFC、ECN 和 NIC 的拥塞控制协同调优时,无损以太网才能正常工作。必须有人完成这项调优并对其负责。
  • 支持模式。 当硬件和软件来自不同公司时,一旦故障跨越两者边界,运营方需要一个明确的负责方。
  • 验证负担。 光模块、线缆、NIC 固件和 NOS 版本都会随时间变化,每种组合都需要在投入生产前进行测试。

OcNOS Systems 将交换机与 OcNOS-DC 作为一套经过验证、可直接部署的完整系统交付,以此解决这三点,所支持的平台与功能组合均公布在硬件兼容性列表和功能矩阵中。

对比

采购 AI 数据中心交换机的三种方式

各方案中的交换芯片往往相同。区别在于由谁选择软件、由谁集成各部分,以及由谁承担测试。

问题同一制造商提供的集成式交换机与 NOS自行集成的开放交换机经过验证的开放系统
硬件选择制造商自有型号买方选择的任意开放交换机OcNOS HCL 中的开放交换机
网络操作系统与硬件绑定由买方选择并安装OcNOS-DC,在该平台上经过验证
由谁集成和测试制造商买方IP Infusion 验证平台与 NOS 的组合
GPU NIC 选择因制造商而异任何支持 RoCEv2 的 NIC任何支持 RoCEv2 的 NIC
工作量所在集成工作量低,选择范围较窄集成工作量最高,选择范围最广集成工作预先完成,在 HCL 范围内选择
迁移到新芯片制造商发布之时买方完成验证之时平台加入 HCL 之时

AI 网络交换机常见问题

什么是 AI 交换机?
AI 交换机是为 GPU 后端 fabric 构建的数据中心以太网交换机。它以高端口基数提供 400G 或 800G 端口,支持基于 PFC 和 ECN 的无损 RoCEv2,并将大流量分散到所有路径上,因为最慢的数据流决定了训练作业的耗时。这一术语描述的是交换机的用途和所支持的功能,而不是一类独立的硬件。
什么是最适合 AI 的交换机?
合适的交换机取决于 GPU 数量、NIC 速率以及可接受的 fabric 层数。对于 800G NIC,拥有 64 个 800G 端口的 51.2 Tbps 交换机在两层无阻塞 fabric 中的算术上限为 2,048 个端点。对于 400G NIC,25.6 Tbps 交换机可在 400G 下提供相同的端口基数。除端口速率外,还应检查 PFC 和 ECN 支持、动态负载均衡、流式遥测,以及网络操作系统是否在该硬件上经过验证。
AI 需要 800G 交换机,还是 400G 就够了?
让交换机与 NIC 相匹配。采用 400G NIC 的集群可搭配 25.6 Tbps 或 12.8 Tbps 交换机。围绕 800G NIC 构建的集群需要 800G 交换机端口,否则每个 GPU 只能获得一半的网络带宽,实际上这意味着需要 51.2 Tbps 交换机。在相同端口基数下,800G 可在不增加 fabric 层级的情况下使每个 GPU 的带宽翻倍。
什么是 GPU fabric 交换机?
这是 GPU 后端网络中 AI 交换机的另一种叫法:即连接各服务器上 GPU NIC 的 leaf、spine 或 super-spine 交换机。在服务器或机架内部,GPU 之间还通过独立的 scale-up 互连通信。GPU fabric 交换机承载服务器之间的 scale-out 流量。
AI 交换机需要深缓冲吗?
在后端 fabric 中通常不需要。大多数 AI 后端 fabric 采用带片上共享缓冲区的高端口基数交换机,依靠 PFC、ECN 和负载均衡防止丢包。深缓冲交换机更常见于网络边缘,例如数据中心互联和服务提供商路由器,这些位置的流量经由长距离或速率不匹配的链路到达。
AI 网络 fabric 能否使用以太网替代 InfiniBand?
可以。RoCEv2 在标准以太网上承载 RDMA,借助 PFC、ECN 和负载均衡,以太网 fabric 可以为 GPU 流量实现无损运行。以太网还能让同一个运维团队、同一套光模块和同一套工具覆盖后端和前端网络。
OcNOS 支持哪些用于 AI fabric 的交换机?
对于 GPU 后端 fabric,OcNOS-DC 运行于 51.2 Tbps Broadcom Tomahawk 5 交换机(Edgecore AIS800-64D、UfiSpace S9321-64E 和 UfiSpace S9321-64EO)以及 25.6 Tbps Tomahawk 4 交换机(Edgecore AS9736-64D)。OcNOS-DC 还已在 12.8 Tbps Tomahawk 3 和 Trident 4 交换机(Edgecore AS9716-32D、Edgecore AS9726-32DB 和 UfiSpace S9300-32D)上完成验证。40+ 个经过验证的平台的完整清单请见 OcNOS 硬件兼容性列表。
相关

延伸阅读:AI fabric 与开放网络

什么是AI组网?

这些交换机所构建的 GPU 后端网络。

AI fabric 架构

AI 数据中心的每个平面及其硬件。

OcNOS AI Fabric

基于 OcNOS-DC 的完整 800G AI fabric。

InfiniBand 与以太网对比

两种传输技术在 AI 场景下的对比。

什么是白盒交换机?

AI 交换机背后的开放硬件模式。

什么是网络操作系统?

将芯片转化为 fabric 的软件。

什么是网络解耦?

分别采购交换机及其软件。

开放网络

开放硬件、开放软件,以及 IP Infusion 的定位。

什么是无损以太网?

PFC、ECN 和 DCQCN,以及它们如何防止丢包。

正在为 GPU 集群选择交换机?从 GPU 数量入手。

告诉我们 GPU 数量、NIC 速率以及可接受的超额订阅比。IP Infusion 工程师将基于运行 OcNOS-DC 的经过验证的交换机,规划 leaf、spine 和 super-spine 各层。