AI 後端 · 儲存 · 前端 · Coherent DCI

AI 資料中心網狀架構

AI 資料中心運行四個網路層,而非單一扁平網路:用於 GPU 對 GPU 集合通訊的 AI 後端網狀架構、儲存網狀架構、前端網狀架構,以及一個隔離的頻外管理層。 Coherent DCI 將訓練延伸至跨站點,而 OcNOS-DC 在經驗證的 Broadcom Tomahawk 硬體上以單一 NOS 運行每一個網路層。

4 planes外加 coherent DCI
1 NOS每個網路層上的 OcNOS-DC
最高 800GTomahawk 5, 64x800G
1 contract單一 TAC、單一 SLA
依網路層界定範圍

設計網路層,而不僅是交換器

大多數 AI 網狀架構的錯誤都是範圍界定的錯誤:團隊規劃了 GPU 層的規模,卻將儲存、租戶存取與管理當作事後補強硬加上去。

應改為依網路層區隔流量,並賦予每一層所需的訂閱比例與隔離。只有 AI 後端網狀架構必須是無阻塞且無損的;其餘三層的存在,是為了將不屬於它的流量隔絕在外。全部四個網路層,加上連接各站點的 coherent 鏈路,皆運行於 OcNOS-DC on HCL-listed Tomahawk 硬體上。

四種網狀架構

每個網路層各司一職

為每個網路層依其自身職責規劃規模,讓其流量各行其道,網狀架構便能在完整的訓練執行下維持可預測性。

Plane 1

AI 後端網狀架構

承載集合通訊的 GPU 對 GPU 網路層。建構為 1:1 無阻塞 軌道最佳化的 leaf-spine pod 或三階 Clos,其底層採用 純 Layer 3 eBGP 底層網路,並透過 RDMA 所需的 RoCEv2 網狀架構維持無損:PFC(包括透過 L3,搭配 DCBX/LLDP)與 ECN。DLB 分散流量,使任何鏈路在 AllReduce 期間都不會成為熱點。

1:1 無阻塞 · RoCEv2 (PFC + ECN) · DLB · TH5 800G
Plane 2

儲存網狀架構

在 GPU 機架與 NVMe-oF 或 NFS 儲存之間搬移檢查點與資料集的 leaf-spine Clos。通常規劃規模接近 3:1,因為儲存突發流量比集合通訊能容忍更高的超訂比例,並維持無損,使 RDMA 儲存流量在負載下不會丟棄。

Leaf-spine Clos · ~3:1 · 無損 RDMA · NVMe-oF / NFS
Plane 3

前端 fabric

供租戶存取、推論服務,以及通往資料中心其餘部分與網際網路之出口路徑的南北向平面。運行 400G 或 800G 存取,其規模依所承載的服務流量而定,而非依後端平面的集合式流量模式而定。

南北向 · 租戶/推論 · 400G / 800G
Plane 4

帶外管理

獨立佈線的另一個 Clos 或 MLAG 平面,讓開通與監控永遠不會與資料平面共命運。承載 ZTP、SNMP 與 syslog,以及 gNMI/OpenConfig 串流遙測,並在資料平面 fabric 重新設定時仍持續運作。

隔離平面 · ZTP · SNMP / syslog · gNMI 遙測
參考架構

四個 fabric 加上 DCI,全在一套 NOS 上

一座資料中心、四個平面,透過相干光學延伸至第二個站點。AI 後端平面採 1:1 無阻塞;儲存、前端與管理則各自以其流量所需的比例運行。每個平面都運行 OcNOS-DC,而 ZR+ DCI 連結可在跨站點間擴展訓練,無需外接轉發器。

AI data center fabric architecture: four planes plus coherent DCI to a second site A single AI data center shown as four stacked network planes: an AI back-end fabric (1:1 non-blocking, RoCEv2 lossless, DLB), a storage fabric (roughly 3:1, NVMe-oF and NFS), a front-end fabric (400G and 800G north-south), and an isolated out-of-band management plane (ZTP, SNMP, syslog, gNMI telemetry). All four planes run OcNOS-DC. A 400G/800G ZR+ coherent DCI link on the UfiSpace S9321-64EO connects the site to a second data center, with multi-DC training reach commonly under about 30 km on ZR+ and longer on OpenZR+. Bottom band: one NOS across AI back-end, storage, front-end, out-of-band management, and coherent DCI. DATA CENTER A · OcNOS-DC AI 後端網狀架構 GPU collectives · rail-optimized / Clos 1:1 non-blocking · RoCEv2 · DLB 儲存網狀架構 checkpoints / datasets · lossless RDMA ~3:1 · NVMe-oF / NFS 前端 fabric north-south · tenant / inference 400G / 800G Out-of-band mgmt ZTP · SNMP / syslog · telemetry isolated plane · gNMI 資料中心 B AI 後端網狀架構 1:1 non-blocking · RoCEv2 Storage + front-end ~3:1 · 400G / 800G Out-of-band mgmt ZR+ DCI 400G / 800G ZR+ COHERENT · S9321-64EO · UNDER ~30 KM ZR+ · OPENZR+ FARTHER (oFEC) ONE NOS · OcNOS-DC · AI BACK-END · STORAGE · FRONT-END · OOB · COHERENT DCI

OcNOS 組件: 每個平面採用路由式 eBGP-unnumbered 底層網路(AI 後端為純 Layer 3 eBGP,並將 EVPN-VXLAN 保留作為租戶覆蓋層,而非 AI 底層網路)、RoCEv2 無損(PFC + ECN、透過 DCBX/LLDP 的 L3 上 PFC)以及後端與儲存平面上的 DLB、供 ZTP 與 gNMI 遙測使用的隔離管理平面,以及 S9321-64EO 上用於 DCI 的 400G/800G ZR+ 相干光學。建構於 HCL 列名的 Tomahawk 5(Edgecore AIS800-64D、UfiSpace S9321-64E / 64EO)與 Tomahawk 4(Edgecore AS9736-64D)硬體之上。

跨站點擴展

相干 DCI,無需外接轉發器

當單一訓練作業超出一座資料機房時,fabric 可透過 400G 與 800G ZR+ 相干可插拔光學,直接從邊界埠延伸跨越 WAN。

The UfiSpace S9321-64EO 是加入 400G ZR+ 相干光學以用於 DCI 的 Tomahawk 5 平台。傳輸距離通常在約 ZR+ 上 30 公里,在使用 oFEC 的 OpenZR+ 上則更長:足以將集合式延遲維持在預算內,同時讓每個站點保有自己不變的 leaf-spine fabric。詳見 相干 DCI 深入解析,了解光學與傳輸距離細節。

The silicon

每個平面運行哪種硬體

每個平面都在 Broadcom Tomahawk 晶片上運行 OcNOS-DC。800G 平面與 DCI 採用 Tomahawk 5;入門與 400G 平面採用 Tomahawk 4。兩者皆為晶片內共享緩衝交換器,且每個平台皆列於 OcNOS 硬體相容性清單。

晶片層 Tomahawk 5800G 平面 + DCI Tomahawk 4入門 + 400G 平面
Broadcom 型號BCM78900BCM56990
交換器容量51.2 Tbps25.6 Tbps
埠配置64×800G64×400G
緩存晶片內共享緩衝;HCL 列名。晶片內共享緩衝;HCL 列名。
平台Edgecore AIS800-64D、UfiSpace S9321-64E。S9321-64EO 加入用於 DCI 的 400G ZR+ 相干光學。Edgecore AS9736-64D。
在設計中的角色800G 的 AI 後端與儲存平面,加上跨站點的相干 DCI。入門型建置以及 400G 前端或管理平面。
一套 NOS,四種角色

一套 NOS 的力量

這四個平面與 DCI 連結並非四項產品。它們是同一套作業系統的四種角色:OcNOS-DC 運行 AI 後端、儲存、前端與帶外管理 fabric,加上相干 DCI,並以一套設定模型與一套透過 gNMI 與 OpenConfig 的遙測堆疊。團隊只需學習一套 CLI、一個自動化介面,以及一組適用於每個平面的計數器。

一套維運模型

無論某個埠是朝向 GPU 的後端 leaf、儲存 leaf、前端邊界,還是管理交換器,都套用相同的路由、QoS 與遙測模型。

單一支援合約

單一份 IP Infusion 合約即涵蓋軟體與經驗證的硬體,並在每個平面上提供一個 TAC 與一份 SLA。NOS 供應商與硬體供應商之間不會互相推諉。

一份硬體清單

每個平面都以同一份 OcNOS 硬體相容性清單建構,因此支援、光學與韌體在整個設計中保持一致。

一條可持續成長的藍圖

藍圖上規劃:fabric 全域 GLB(OcNOS 7.1)、以延遲為基礎的 ECN(7.1.0),以及 LLR、CBFS 與封包修剪。即將推出的 Tomahawk 6 晶片(BCM78910 / BCM78914,102.4 Tbps,TSMC 3nm)搭載 OcNOS 7.2 版本,並以更高的 radix 延伸相同的設計。從第一天就建好遙測平面,讓這些功能以軟體步驟的形式到位。

常見問題

AI fabric 架構常見問題

AI 資料中心由哪些 fabric 組成?
AI 資料中心運行四個網路平面。 AI 後端網狀架構 承載 GPU 對 GPU 的集合式流量,是必須做到無阻塞且無損的那一個。 儲存 fabric 透過 RDMA 在 GPU 機架之間搬移檢查點與資料集。 前端 fabric 處理南北向、租戶與推論存取。獨立的 帶外管理 平面以自己的佈線開通交換器並串流遙測。相干 DCI 將此設計延伸至跨站點。OcNOS-DC 運行全部四個平面加上 DCI。
每個 fabric 應採用多少超額訂閱比?
AI 後端 fabric 在 GPU 平面上應為 1:1 無阻塞 ,因為那裡的熱點連結會使整個集合作業停滯,而每個 GPU 都得等待最慢的傳輸。儲存 fabric 通常運行接近成本最佳化的比例 3:1,因為儲存突發流量對延遲的敏感度低於集合作業。前端與帶外管理平面承載較輕、較不突發的流量,可容忍較高的超額訂閱。將比例對應到每個平面實際承載的流量。
如何連接兩座 AI 資料中心?
使用相干 DCI:邊界埠上的 400G 與 800G ZR+ 可插拔光學,無需外接轉發器。在 OcNOS-DC 上, UfiSpace S9321-64EO 正是為此加入 400G ZR+ 相干光學。多資料中心訓練的傳輸距離通常在約 ZR+ 上 30 公里,在使用 oFEC 的 OpenZR+ 上則更長。這讓單一訓練作業可橫跨一座以上的資料機房,同時讓每個站點保有自己不變的 leaf-spine fabric。
一套 NOS 能運行所有 fabric 嗎?
Yes. OcNOS-DC 在同一套作業系統上運行 AI 後端、儲存、前端與帶外管理平面,加上相干 DCI。這代表一套設定模型、一套透過 gNMI 與 OpenConfig 的遙測堆疊,以及 一份 IP Infusion 支援合約 涵蓋軟體與經驗證的硬體,並在設計中的每個平面上提供一個 TAC 與一份 SLA。
每個平面運行哪種硬體?
全部四個平面都在 Broadcom Tomahawk 晶片上運行 OcNOS-DC。800G 平面使用 Tomahawk 5 (BCM78900,51.2 Tbps,64×800G):Edgecore AIS800-64D 或 UfiSpace S9321-64E,其中 S9321-64EO 加入用於 DCI 的 400G ZR+ 相干光學。入門與 400G 平面使用 Tomahawk 4 (BCM56990,25.6 Tbps,64×400G),例如 Edgecore AS9736-64D。這些皆為晶片內共享緩衝交換器,且每一個都列於 OcNOS 硬體相容性清單。

要設計完整的 AI 資料中心嗎?我們會與您一起規劃每個平面。

告訴我們 GPU 規模與工作負載,IP Infusion 工程師便會與您一起為後端、儲存、前端、管理與 DCI 平面進行規模設計,或在 AI Fabric Design Suite 中先從初版佈局開始。