AI 后端 · 存储 · 前端 · 相干 DCI

AI 数据中心 fabric 架构

AI 数据中心运行的是四个网络平面,而非一张扁平网络:用于 GPU 间集合通信的 AI 后端 fabric、存储 fabric、前端 fabric,以及一个隔离的带外管理平面。 相干 DCI 把训练扩展到多个站点,而 OcNOS-DC 以单一 NOS 在经过验证的 Broadcom Tomahawk 硬件上运行每一个平面。

4 planes外加相干 DCI
1 NOS每个平面上的 OcNOS-DC
最高 800GTomahawk 5,64x800G
1 contract一个 TAC,一个 SLA
按平面界定范围

设计各个平面,而不仅是交换机

多数 AI fabric 的失误都是范围界定上的失误:团队先为 GPU 平面设定规格,然后把存储、租户接入和管理作为事后附加物硬拼上去。

应改为按平面分离流量,并为每个平面赋予其所需的收敛比和隔离。只有 AI 后端 fabric 必须无阻塞且无损;另外三个平面的存在,是为了把不属于它的流量挡在外面。全部四个平面,以及连接各站点的相干链路,都运行在 OcNOS-DC on HCL-listed Tomahawk 硬件之上。

四张 fabric

每个平面各司一职

为每个平面按其自身职责设定规格,让其流量走各自的线路,fabric 便能在一次完整训练运行下保持可预测。

Plane 1

AI 后端 fabric

承载集合通信的 GPU 间平面。构建为 1:1 无阻塞 ,形式为 rail 优化 leaf-spine pod 或三级 Clos,运行在 纯三层 eBGP underlay之上,并以 RDMA 所需的 RoCEv2 fabric 保持无损:PFC(包括三层、配合 DCBX/LLDP)和 ECN。DLB 分散流量,使 AllReduce 期间没有链路成为热点。

1:1 无阻塞 · RoCEv2(PFC + ECN) · DLB · TH5 800G
Plane 2

存储 fabric

一张 leaf-spine Clos,在 GPU 机架与 NVMe-oF 或 NFS 存储之间搬移检查点和数据集。通常按接近 3:1的比例设定规格,因为存储突发比集合通信能容忍更高的收敛比,同时保持无损,使 RDMA 存储流量在负载下不丢包。

Leaf-spine Clos · ~3:1 · 无损 RDMA · NVMe-oF / NFS
Plane 3

前端 fabric

用于租户接入、推理服务,以及通往数据中心其余部分和互联网的南北向平面。运行 400G 或 800G 接入,按其承载的业务流量而非后端平面的集合通信模式来设定规格。

南北向 · 租户 / 推理 · 400G / 800G
Plane 4

带外管理

一个走独立线路的单独 Clos 或 MLAG 平面,因此上线调试和监控绝不与数据平面同命运。承载 ZTP、SNMP 和 syslog,以及 gNMI/OpenConfig 流式遥测,并在数据平面 fabric 被重新配置时保持工作。

隔离平面 · ZTP · SNMP / syslog · gNMI 遥测
参考架构

四张 fabric 外加 DCI,运行在一套 NOS 上

一个数据中心,四个平面,通过相干光模块扩展到第二个站点。AI 后端平面为 1:1 无阻塞;存储、前端和管理各自按其流量所需的比例运行。每个平面都运行 OcNOS-DC,ZR+ DCI 链路无需外部转发器即可把训练扩展到多个站点。

AI data center fabric architecture: four planes plus coherent DCI to a second site A single AI data center shown as four stacked network planes: an AI back-end fabric (1:1 non-blocking, RoCEv2 lossless, DLB), a storage fabric (roughly 3:1, NVMe-oF and NFS), a front-end fabric (400G and 800G north-south), and an isolated out-of-band management plane (ZTP, SNMP, syslog, gNMI telemetry). All four planes run OcNOS-DC. A 400G/800G ZR+ coherent DCI link on the UfiSpace S9321-64EO connects the site to a second data center, with multi-DC training reach commonly under about 30 km on ZR+ and longer on OpenZR+. Bottom band: one NOS across AI back-end, storage, front-end, out-of-band management, and coherent DCI. DATA CENTER A · OcNOS-DC AI 后端 fabric GPU collectives · rail-optimized / Clos 1:1 non-blocking · RoCEv2 · DLB 存储 fabric checkpoints / datasets · lossless RDMA ~3:1 · NVMe-oF / NFS 前端 fabric north-south · tenant / inference 400G / 800G Out-of-band mgmt ZTP · SNMP / syslog · telemetry isolated plane · gNMI 数据中心 B AI 后端 fabric 1:1 non-blocking · RoCEv2 Storage + front-end ~3:1 · 400G / 800G Out-of-band mgmt ZR+ DCI 400G / 800G ZR+ COHERENT · S9321-64EO · UNDER ~30 KM ZR+ · OPENZR+ FARTHER (oFEC) ONE NOS · OcNOS-DC · AI BACK-END · STORAGE · FRONT-END · OOB · COHERENT DCI

OcNOS 组件: 每个平面一张路由式 eBGP-unnumbered underlay(AI 后端为纯三层 eBGP,EVPN-VXLAN 作为租户 overlay 保留,而非 AI underlay),后端和存储平面采用无损 RoCEv2(PFC + ECN,三层 PFC 配合 DCBX/LLDP)和 DLB,一个用于 ZTP 和 gNMI 遥测的隔离管理平面,以及 S9321-64EO 上用于 DCI 的 400G/800G ZR+ 相干光模块。构建于 HCL 收录的 Tomahawk 5(Edgecore AIS800-64D、UfiSpace S9321-64E / 64EO)和 Tomahawk 4(Edgecore AS9736-64D)硬件之上。

跨站点扩展

相干 DCI,无需外部转发器

当一次训练运行超出单个机房时,fabric 通过 400G 和 800G ZR+ 相干可插拔光模块跨 WAN 延伸,直接从边界端口引出。

The UfiSpace S9321-64EO 是为 DCI 增加 400G ZR+ 相干光模块的 Tomahawk 5 平台。覆盖距离通常约在 ZR+ 下 30 km以内,使用 oFEC 的 OpenZR+ 则可更远:足够近以将集合通信延迟控制在预算之内,同时每个站点各自的 leaf-spine fabric 保持不变。参见 相干 DCI 深度解析,了解光模块和覆盖距离细节。

The silicon

每个平面运行什么硬件

每个平面都在 Broadcom Tomahawk 芯片上运行 OcNOS-DC。800G 平面和 DCI 采用 Tomahawk 5;入门级和 400G 平面采用 Tomahawk 4。两者都是片上共享缓冲交换机,且每个平台都在 OcNOS 硬件兼容性列表中。

芯片层 Tomahawk 5800G 平面 + DCI Tomahawk 4入门级 + 400G 平面
Broadcom 型号BCM78900BCM56990
交换容量51.2 Tbps25.6 Tbps
端口配置64×800G64×400G
缓存片上共享缓冲;HCL 收录。片上共享缓冲;HCL 收录。
平台Edgecore AIS800-64D、UfiSpace S9321-64E。S9321-64EO 为 DCI 增加 400G ZR+ 相干光模块。Edgecore AS9736-64D。
在设计中的角色800G 的 AI 后端和存储平面,外加跨站点的相干 DCI。入门级构建,以及 400G 前端或管理平面。
一套 NOS,四种角色

一套 NOS 的力量

这四个平面和 DCI 链路并非四款产品。它们是同一套操作系统的四种角色:OcNOS-DC 运行 AI 后端、存储、前端和带外管理 fabric,外加相干 DCI,采用一套配置模型和一套基于 gNMI 与 OpenConfig 的遥测栈。团队只需学习一套 CLI、一个自动化界面,以及适用于每个平面的一套计数器。

一套运营模式

无论某个端口是面向 GPU 的后端 leaf、存储 leaf、前端边界,还是管理交换机,都适用同一套路由、QoS 和遥测模型。

一份支持合同

一份 IP Infusion 合同即涵盖软件和经过验证的硬件,并在每个平面上配以一个 TAC 和一个 SLA。不会出现 NOS 厂商与硬件厂商之间互相推诿。

一份硬件列表

每个平面都从同一份 OcNOS 硬件兼容性列表构建,因此支持、光模块和固件在整个设计中保持一致。

一份可持续演进的路线图

路线图中包括:全 fabric 的 GLB(OcNOS 7.1)、基于延迟的 ECN(7.1.0),以及 LLR、CBFS 和数据包裁剪。即将推出的 Tomahawk 6 芯片(BCM78910 / BCM78914,102.4 Tbps,TSMC 3nm)搭载 OcNOS 7.2 版本系列,在更高基数上扩展同一设计。从第一天起就把遥测平面构建进来,这样这些能力便能以软件步骤的形式到来。

常见问题

AI fabric 架构常见问题解答

AI 数据中心由哪些 fabric 组成?
AI 数据中心运行四个网络平面。 AI 后端 fabric 承载 GPU 间集合通信流量,是必须无阻塞且无损的那一个。 存储 fabric 通过 RDMA 在 GPU 机架之间搬入搬出检查点和数据集。 前端 fabric 处理南北向、租户和推理接入。一个单独的 带外管理 平面在自己的线路上启动交换机并流式输出遥测。相干 DCI 把该设计扩展到多个站点。OcNOS-DC 运行全部四个平面外加 DCI。
每张 fabric 应采用怎样的收敛比?
AI 后端 fabric 应为 1:1 无阻塞 ,就 GPU 平面而言,因为那里一条热点链路会拖停整个集合通信,每个 GPU 都要等待最慢的传输。存储 fabric 通常采用接近 3:1的成本优化比例,因为存储突发对延迟的敏感度低于集合通信。前端和带外管理平面承载更轻、突发更少的流量,可容忍更高的收敛比。让比例与每个平面实际承载的流量相匹配。
如何连接两个 AI 数据中心?
使用相干 DCI:在边界端口上采用 400G 和 800G ZR+ 可插拔光模块,无需外部转发器。在 OcNOS-DC 上, UfiSpace S9321-64EO 正是为此增加了 400G ZR+ 相干光模块。多数据中心训练的覆盖距离通常约在 ZR+ 下 30 km以内,使用 oFEC 的 OpenZR+ 则可更远。这让一次训练运行得以跨越多个机房,同时每个站点各自的 leaf-spine fabric 保持不变。
一套 NOS 能运行所有 fabric 吗?
Yes. OcNOS-DC 在同一套操作系统上运行 AI 后端、存储、前端和带外管理平面,外加相干 DCI。这意味着一套配置模型、一套基于 gNMI 和 OpenConfig 的遥测栈,以及 一份 IP Infusion 支持合同 ,涵盖软件和经过验证的硬件,并在设计中的每个平面上配以一个 TAC 和一个 SLA。
每个平面运行什么硬件?
全部四个平面都在 Broadcom Tomahawk 芯片上运行 OcNOS-DC。800G 平面采用 Tomahawk 5 (BCM78900,51.2 Tbps,64×800G):Edgecore AIS800-64D 或 UfiSpace S9321-64E,其中 S9321-64EO 为 DCI 增加 400G ZR+ 相干光模块。入门级和 400G 平面采用 Tomahawk 4 (BCM56990,25.6 Tbps,64×400G),例如 Edgecore AS9736-64D。这些都是片上共享缓冲交换机,且每一款都收录于 OcNOS 硬件兼容性列表中。

在设计完整的 AI 数据中心?我们将与您一起规划每个平面。

告诉我们 GPU 规模和工作负载,IP Infusion 的工程师将与您一起为后端、存储、前端、管理和 DCI 平面设定规格,或先在 AI Fabric Design Suite 中生成一版初步布局。