AI 数据中心 fabric 架构
AI 数据中心运行的是四个网络平面,而非一张扁平网络:用于 GPU 间集合通信的 AI 后端 fabric、存储 fabric、前端 fabric,以及一个隔离的带外管理平面。 相干 DCI 把训练扩展到多个站点,而 OcNOS-DC 以单一 NOS 在经过验证的 Broadcom Tomahawk 硬件上运行每一个平面。
设计各个平面,而不仅是交换机
多数 AI fabric 的失误都是范围界定上的失误:团队先为 GPU 平面设定规格,然后把存储、租户接入和管理作为事后附加物硬拼上去。
应改为按平面分离流量,并为每个平面赋予其所需的收敛比和隔离。只有 AI 后端 fabric 必须无阻塞且无损;另外三个平面的存在,是为了把不属于它的流量挡在外面。全部四个平面,以及连接各站点的相干链路,都运行在 OcNOS-DC on HCL-listed Tomahawk 硬件之上。
每个平面各司一职
为每个平面按其自身职责设定规格,让其流量走各自的线路,fabric 便能在一次完整训练运行下保持可预测。
AI 后端 fabric
承载集合通信的 GPU 间平面。构建为 1:1 无阻塞 ,形式为 rail 优化 leaf-spine pod 或三级 Clos,运行在 纯三层 eBGP underlay之上,并以 RDMA 所需的 RoCEv2 fabric 保持无损:PFC(包括三层、配合 DCBX/LLDP)和 ECN。DLB 分散流量,使 AllReduce 期间没有链路成为热点。
存储 fabric
一张 leaf-spine Clos,在 GPU 机架与 NVMe-oF 或 NFS 存储之间搬移检查点和数据集。通常按接近 3:1的比例设定规格,因为存储突发比集合通信能容忍更高的收敛比,同时保持无损,使 RDMA 存储流量在负载下不丢包。
前端 fabric
用于租户接入、推理服务,以及通往数据中心其余部分和互联网的南北向平面。运行 400G 或 800G 接入,按其承载的业务流量而非后端平面的集合通信模式来设定规格。
带外管理
一个走独立线路的单独 Clos 或 MLAG 平面,因此上线调试和监控绝不与数据平面同命运。承载 ZTP、SNMP 和 syslog,以及 gNMI/OpenConfig 流式遥测,并在数据平面 fabric 被重新配置时保持工作。
四张 fabric 外加 DCI,运行在一套 NOS 上
一个数据中心,四个平面,通过相干光模块扩展到第二个站点。AI 后端平面为 1:1 无阻塞;存储、前端和管理各自按其流量所需的比例运行。每个平面都运行 OcNOS-DC,ZR+ DCI 链路无需外部转发器即可把训练扩展到多个站点。
OcNOS 组件: 每个平面一张路由式 eBGP-unnumbered underlay(AI 后端为纯三层 eBGP,EVPN-VXLAN 作为租户 overlay 保留,而非 AI underlay),后端和存储平面采用无损 RoCEv2(PFC + ECN,三层 PFC 配合 DCBX/LLDP)和 DLB,一个用于 ZTP 和 gNMI 遥测的隔离管理平面,以及 S9321-64EO 上用于 DCI 的 400G/800G ZR+ 相干光模块。构建于 HCL 收录的 Tomahawk 5(Edgecore AIS800-64D、UfiSpace S9321-64E / 64EO)和 Tomahawk 4(Edgecore AS9736-64D)硬件之上。
相干 DCI,无需外部转发器
当一次训练运行超出单个机房时,fabric 通过 400G 和 800G ZR+ 相干可插拔光模块跨 WAN 延伸,直接从边界端口引出。
The UfiSpace S9321-64EO 是为 DCI 增加 400G ZR+ 相干光模块的 Tomahawk 5 平台。覆盖距离通常约在 ZR+ 下 30 km以内,使用 oFEC 的 OpenZR+ 则可更远:足够近以将集合通信延迟控制在预算之内,同时每个站点各自的 leaf-spine fabric 保持不变。参见 相干 DCI 深度解析,了解光模块和覆盖距离细节。
每个平面运行什么硬件
每个平面都在 Broadcom Tomahawk 芯片上运行 OcNOS-DC。800G 平面和 DCI 采用 Tomahawk 5;入门级和 400G 平面采用 Tomahawk 4。两者都是片上共享缓冲交换机,且每个平台都在 OcNOS 硬件兼容性列表中。
| 芯片层 | Tomahawk 5800G 平面 + DCI | Tomahawk 4入门级 + 400G 平面 |
|---|---|---|
| Broadcom 型号 | BCM78900 | BCM56990 |
| 交换容量 | 51.2 Tbps | 25.6 Tbps |
| 端口配置 | 64×800G | 64×400G |
| 缓存 | 片上共享缓冲;HCL 收录。 | 片上共享缓冲;HCL 收录。 |
| 平台 | Edgecore AIS800-64D、UfiSpace S9321-64E。S9321-64EO 为 DCI 增加 400G ZR+ 相干光模块。 | Edgecore AS9736-64D。 |
| 在设计中的角色 | 800G 的 AI 后端和存储平面,外加跨站点的相干 DCI。 | 入门级构建,以及 400G 前端或管理平面。 |
一套 NOS 的力量
这四个平面和 DCI 链路并非四款产品。它们是同一套操作系统的四种角色:OcNOS-DC 运行 AI 后端、存储、前端和带外管理 fabric,外加相干 DCI,采用一套配置模型和一套基于 gNMI 与 OpenConfig 的遥测栈。团队只需学习一套 CLI、一个自动化界面,以及适用于每个平面的一套计数器。
一套运营模式
无论某个端口是面向 GPU 的后端 leaf、存储 leaf、前端边界,还是管理交换机,都适用同一套路由、QoS 和遥测模型。
一份支持合同
一份 IP Infusion 合同即涵盖软件和经过验证的硬件,并在每个平面上配以一个 TAC 和一个 SLA。不会出现 NOS 厂商与硬件厂商之间互相推诿。
一份可持续演进的路线图
路线图中包括:全 fabric 的 GLB(OcNOS 7.1)、基于延迟的 ECN(7.1.0),以及 LLR、CBFS 和数据包裁剪。即将推出的 Tomahawk 6 芯片(BCM78910 / BCM78914,102.4 Tbps,TSMC 3nm)搭载 OcNOS 7.2 版本系列,在更高基数上扩展同一设计。从第一天起就把遥测平面构建进来,这样这些能力便能以软件步骤的形式到来。
AI fabric 架构常见问题解答
AI 数据中心由哪些 fabric 组成?
每张 fabric 应采用怎样的收敛比?
如何连接两个 AI 数据中心?
一套 NOS 能运行所有 fabric 吗?
每个平面运行什么硬件?
深入了解,随身带走。
产品数据手册,以及内容比本页更为深入的简明技术下载资料。
OcNOS-DC 数据手册
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
OcNOS 800G 无损 AI Fabric
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
EVPN-VXLAN 数据中心网络
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
在设计完整的 AI 数据中心?我们将与您一起规划每个平面。
告诉我们 GPU 规模和工作负载,IP Infusion 的工程师将与您一起为后端、存储、前端、管理和 DCI 平面设定规格,或先在 AI Fabric Design Suite 中生成一版初步布局。
用 OcNOS 设计整张 AI fabric
从商业论证到端口数量测算,无论您进行到哪一步,都可从此接续。