什么是 AI 网络交换机?
AI 网络交换机是一种高端口基数(high-radix)的数据中心以太网交换机,每端口速率通常为 400G 或 800G,用于在 AI 后端 fabric 中连接 GPU 服务器,并借助 PFC、ECN 和自适应负载均衡保持 RDMA 流量无损,因为最慢的数据流决定了训练作业的耗时。 IP Infusion 开发运行这类交换机的网络操作系统 OcNOS-DC,并在 51.2 Tbps Broadcom Tomahawk 5 以及 25.6 Tbps 和 12.8 Tbps 平台上以经过验证的完整系统形式交付。
数据中心交换机成为 AI 交换机的条件
当交换机能够以训练集群所需的速率、规模和丢包率承载 GPU 流量时,才称得上 AI 交换机。它由五项特性区分开来。这些交换机所构成的网络请参阅 什么是 AI fabric;本页介绍的是交换机本身。
- 端口速率与容量。 GPU NIC 以 400G 和 800G 接入,交换机端口必须与之匹配。51.2 Tbps 交换机提供 64 个 800G 端口;25.6 Tbps 交换机提供 64 个 400G 端口。
- 端口基数(Radix)。 每台交换机的端口数决定一个 leaf 能服务多少 GPU、一个 spine 能连接多少 leaf,进而决定 fabric 需要多少层。层级越少,跳数、光模块和功耗就越少。
- 无损传输。 GPU 之间通过融合以太网上的 RDMA(RoCEv2)交换数据,一旦丢包,性能会急剧下降。交换机需要优先级流量控制(PFC)在队列溢出前暂停该队列,并需要显式拥塞通知(ECN)尽早提醒发送方,与 NIC 上的 DCQCN 拥塞控制协同工作。
- 负载均匀。 AllReduce 等集合通信操作会产生少量非常大的数据流。静态哈希可能将其中两条放到同一链路上,而另一条链路却处于空闲。 动态负载均衡 将流量转移到负载较低的路径。
- 可视性。 流式遥测 实时报告队列深度、PFC 暂停和 ECN 标记,使运维人员能够找到拖慢作业的那条链路。
AI 交换机在 AI 网络 fabric 中的位置
AI 数据中心同时运行四张网络,每张网络对交换机的要求各不相同。大多数人所说的 AI 交换机,指的是 GPU 后端 fabric 中的交换机。
GPU 后端 fabric
连接各服务器上的 GPU NIC,用于训练和推理。采用 rail 优化的 leaf 与 Clos spine ,速率为 400G 或 800G,端到端无损运行。端口速率和端口基数在这里最为关键。
在后端 fabric 内部,同一型号的交换机可以用作 rail leaf、spine 或 super-spine。rail 优化设计将服务器中的每块 GPU NIC 连接到不同的 leaf,使同序号 GPU 之间的流量只相隔一跳。拓扑决定角色; AI fabric 拓扑 和 rail 优化网络 介绍了这些设计。
AI 交换机的采购方包括 neocloud 和 GPU 云服务商、大型企业数据中心和 MSP,以及在自有数据中心中增加 GPU 容量的服务提供商。
800G 还是 400G:按端口基数规划 AI 交换机
交换机的端口数决定 fabric 在需要增加一层之前能扩展到多大。在无阻塞的两层 leaf-spine 中,每个 leaf 将端口平均分配给 GPU 和 spine,每个 spine 端口连接一个 leaf。因此,一台拥有 k 个端口的交换机在两层中可支持 k 的平方除以二个端点,在三层中可支持 k 的立方除以四个端点。
| 交换容量 | 全速率端口数 | 两层,无阻塞 | 三层,无阻塞 |
|---|---|---|---|
| 51.2 Tbps | 64 个 800G | 2,048 个 800G 端点 | 65,536 个 800G 端点 |
| 25.6 Tbps | 64 个 400G | 2,048 个 400G 端点 | 65,536 个 400G 端点 |
| 12.8 Tbps | 32 个 400G | 512 个 400G 端点 | 8,192 个 400G 端点 |
- 这些是算术上限, 而非产品规模数据。实际设计会受到超额订阅、每台服务器的 rail 数、光模块传输距离和机架功率的影响。
- 在相同端口基数下,800G 可在不增加层级的情况下使每个 GPU 的带宽翻倍。这就是围绕 800G NIC 构建的后端 fabric 采用 51.2 Tbps 交换机的原因。
- IP Infusion 参考设计 适用于 rail 优化和三级 Clos fabric,按实际端口数量规划,详见 AI fabric 拓扑。设计之间如何取舍,请参阅 如何选择 AI 网络 fabric.
经 OcNOS-DC 验证的 AI 数据中心交换机
OcNOS-DC 是 IP Infusion 面向数据中心和 AI fabric 的网络操作系统。它运行于基于 Broadcom 芯片的开放交换机,下列每个平台均列于 OcNOS 硬件兼容性列表,该列表共涵盖 40+ 个经过验证的平台。
| 容量 | Broadcom ASIC | 经过验证的平台 | 在 AI 数据中心中的典型位置 |
|---|---|---|---|
| 51.2 Tbps | Tomahawk 5 (BCM78900) | Edgecore AIS800-64D、UfiSpace S9321-64E、UfiSpace S9321-64EO | 800G 后端 leaf 和 spine;S9321-64EO 还可承载 相干 DCI ,用于站点之间互联 |
| 25.6 Tbps | Tomahawk 4 (BCM56990) | Edgecore AS9736-64D(DCS520) | 400G 后端 fabric、存储网络或前端网络 |
| 12.8 Tbps | Tomahawk 3 (BCM56980) | Edgecore AS9716-32D(DCS510) | 面向较小规模 fabric 和前端网络的 400G spine |
| 12.8 Tbps | Trident 4 (BCM56880) | Edgecore AS9726-32DB(DCS240),UfiSpace S9300-32D | 面向前端和存储网络的 400G leaf;支持 IPoDWDM |
OcNOS-DC 为交换机带来的能力
- 无损 RoCEv2: PFC(包括基于三层路由 underlay 的 PFC)、 PFC 死锁检测与恢复、支持 DCQCN 调优的 ECN,以及用于按流量类别分配带宽的 DCBX 和 ETS。
- 负载均衡: 用于感知 flowlet 的自适应路由的动态负载均衡(DLB),以及 全局负载均衡(GLB) ,用于 OcNOS 7.1 中的全 fabric 路径优化。
- 多租户 GPU 云: EVPN-VXLAN 在共享 fabric 上隔离租户。在 Trident 3 X4、X5、X7 和 Trident 4 平台上,基于 VXLAN 的 ECN 和 PFC 还可在 overlay 中传递拥塞信号。
- 运维: 基于 gNMI 和 OpenConfig 的流式遥测,以及 NETCONF、YANG 和零接触部署.
- 许可与平台支持: DLB、PFC 死锁检测与恢复以及基于 VXLAN 的 ECN 属于 OcNOS-DC PLUS 层级功能,支持情况因平台而异。 OcNOS 功能矩阵 按平台和层级列出 700+ 项功能。
- 管理网络: 1G Trident 3 X2 平台(Edgecore AS4625-54T、Celestica DS1000 和 UfiSpace S6301-56ST,每款 120 Gbps)以同一 NOS 运行带外网络。
开放 AI 交换机带来什么,又要求什么
采用独立网络操作系统的开放交换机,改变了选择权和工作量各自所在的位置。
您将获得
- 硬件选择。 OcNOS-DC 运行于多家硬件制造商的交换机,因此每个平面都可以按容量、光模块和交付周期进行选择。
- 跨平面统一 NOS。 后端、存储、前端和管理网络运行同一个操作系统、同一套 CLI 和同一种自动化模型。
- 标准以太网。 RoCEv2 fabric 使用与数据中心其余部分相同的光模块、布线和工具,GPU NIC 可以独立于交换机进行选择。
- 通往新芯片的路径。 从 25.6 Tbps 升级到 51.2 Tbps 更换的是交换机,而不是运维模式。
提出的要求
- 集成。 只有当交换机缓冲区、PFC、ECN 和 NIC 的拥塞控制协同调优时,无损以太网才能正常工作。必须有人完成这项调优并对其负责。
- 支持模式。 当硬件和软件来自不同公司时,一旦故障跨越两者边界,运营方需要一个明确的负责方。
- 验证负担。 光模块、线缆、NIC 固件和 NOS 版本都会随时间变化,每种组合都需要在投入生产前进行测试。
OcNOS Systems 将交换机与 OcNOS-DC 作为一套经过验证、可直接部署的完整系统交付,以此解决这三点,所支持的平台与功能组合均公布在硬件兼容性列表和功能矩阵中。
采购 AI 数据中心交换机的三种方式
各方案中的交换芯片往往相同。区别在于由谁选择软件、由谁集成各部分,以及由谁承担测试。
| 问题 | 同一制造商提供的集成式交换机与 NOS | 自行集成的开放交换机 | 经过验证的开放系统 |
|---|---|---|---|
| 硬件选择 | 制造商自有型号 | 买方选择的任意开放交换机 | OcNOS HCL 中的开放交换机 |
| 网络操作系统 | 与硬件绑定 | 由买方选择并安装 | OcNOS-DC,在该平台上经过验证 |
| 由谁集成和测试 | 制造商 | 买方 | IP Infusion 验证平台与 NOS 的组合 |
| GPU NIC 选择 | 因制造商而异 | 任何支持 RoCEv2 的 NIC | 任何支持 RoCEv2 的 NIC |
| 工作量所在 | 集成工作量低,选择范围较窄 | 集成工作量最高,选择范围最广 | 集成工作预先完成,在 HCL 范围内选择 |
| 迁移到新芯片 | 制造商发布之时 | 买方完成验证之时 | 平台加入 HCL 之时 |
AI 网络交换机常见问题
什么是 AI 交换机?
什么是最适合 AI 的交换机?
AI 需要 800G 交换机,还是 400G 就够了?
什么是 GPU fabric 交换机?
AI 交换机需要深缓冲吗?
AI 网络 fabric 能否使用以太网替代 InfiniBand?
OcNOS 支持哪些用于 AI fabric 的交换机?
延伸阅读:AI fabric 与开放网络
深入了解,随身带走。
两份简短的技术下载资料,比本页更深入:完整的 OcNOS-DC 数据表和无损 800G AI fabric 架构。
OcNOS-DC 数据手册
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
OcNOS 800G 无损 AI Fabric
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。