AI 資料中心網狀架構
AI 資料中心運行四個網路層,而非單一扁平網路:用於 GPU 對 GPU 集合通訊的 AI 後端網狀架構、儲存網狀架構、前端網狀架構,以及一個隔離的頻外管理層。 Coherent DCI 將訓練延伸至跨站點,而 OcNOS-DC 在經驗證的 Broadcom Tomahawk 硬體上以單一 NOS 運行每一個網路層。
設計網路層,而不僅是交換器
大多數 AI 網狀架構的錯誤都是範圍界定的錯誤:團隊規劃了 GPU 層的規模,卻將儲存、租戶存取與管理當作事後補強硬加上去。
應改為依網路層區隔流量,並賦予每一層所需的訂閱比例與隔離。只有 AI 後端網狀架構必須是無阻塞且無損的;其餘三層的存在,是為了將不屬於它的流量隔絕在外。全部四個網路層,加上連接各站點的 coherent 鏈路,皆運行於 OcNOS-DC on HCL-listed Tomahawk 硬體上。
每個網路層各司一職
為每個網路層依其自身職責規劃規模,讓其流量各行其道,網狀架構便能在完整的訓練執行下維持可預測性。
AI 後端網狀架構
承載集合通訊的 GPU 對 GPU 網路層。建構為 1:1 無阻塞 軌道最佳化的 leaf-spine pod 或三階 Clos,其底層採用 純 Layer 3 eBGP 底層網路,並透過 RDMA 所需的 RoCEv2 網狀架構維持無損:PFC(包括透過 L3,搭配 DCBX/LLDP)與 ECN。DLB 分散流量,使任何鏈路在 AllReduce 期間都不會成為熱點。
儲存網狀架構
在 GPU 機架與 NVMe-oF 或 NFS 儲存之間搬移檢查點與資料集的 leaf-spine Clos。通常規劃規模接近 3:1,因為儲存突發流量比集合通訊能容忍更高的超訂比例,並維持無損,使 RDMA 儲存流量在負載下不會丟棄。
前端 fabric
供租戶存取、推論服務,以及通往資料中心其餘部分與網際網路之出口路徑的南北向平面。運行 400G 或 800G 存取,其規模依所承載的服務流量而定,而非依後端平面的集合式流量模式而定。
帶外管理
獨立佈線的另一個 Clos 或 MLAG 平面,讓開通與監控永遠不會與資料平面共命運。承載 ZTP、SNMP 與 syslog,以及 gNMI/OpenConfig 串流遙測,並在資料平面 fabric 重新設定時仍持續運作。
四個 fabric 加上 DCI,全在一套 NOS 上
一座資料中心、四個平面,透過相干光學延伸至第二個站點。AI 後端平面採 1:1 無阻塞;儲存、前端與管理則各自以其流量所需的比例運行。每個平面都運行 OcNOS-DC,而 ZR+ DCI 連結可在跨站點間擴展訓練,無需外接轉發器。
OcNOS 組件: 每個平面採用路由式 eBGP-unnumbered 底層網路(AI 後端為純 Layer 3 eBGP,並將 EVPN-VXLAN 保留作為租戶覆蓋層,而非 AI 底層網路)、RoCEv2 無損(PFC + ECN、透過 DCBX/LLDP 的 L3 上 PFC)以及後端與儲存平面上的 DLB、供 ZTP 與 gNMI 遙測使用的隔離管理平面,以及 S9321-64EO 上用於 DCI 的 400G/800G ZR+ 相干光學。建構於 HCL 列名的 Tomahawk 5(Edgecore AIS800-64D、UfiSpace S9321-64E / 64EO)與 Tomahawk 4(Edgecore AS9736-64D)硬體之上。
相干 DCI,無需外接轉發器
當單一訓練作業超出一座資料機房時,fabric 可透過 400G 與 800G ZR+ 相干可插拔光學,直接從邊界埠延伸跨越 WAN。
The UfiSpace S9321-64EO 是加入 400G ZR+ 相干光學以用於 DCI 的 Tomahawk 5 平台。傳輸距離通常在約 ZR+ 上 30 公里,在使用 oFEC 的 OpenZR+ 上則更長:足以將集合式延遲維持在預算內,同時讓每個站點保有自己不變的 leaf-spine fabric。詳見 相干 DCI 深入解析,了解光學與傳輸距離細節。
每個平面運行哪種硬體
每個平面都在 Broadcom Tomahawk 晶片上運行 OcNOS-DC。800G 平面與 DCI 採用 Tomahawk 5;入門與 400G 平面採用 Tomahawk 4。兩者皆為晶片內共享緩衝交換器,且每個平台皆列於 OcNOS 硬體相容性清單。
| 晶片層 | Tomahawk 5800G 平面 + DCI | Tomahawk 4入門 + 400G 平面 |
|---|---|---|
| Broadcom 型號 | BCM78900 | BCM56990 |
| 交換器容量 | 51.2 Tbps | 25.6 Tbps |
| 埠配置 | 64×800G | 64×400G |
| 緩存 | 晶片內共享緩衝;HCL 列名。 | 晶片內共享緩衝;HCL 列名。 |
| 平台 | Edgecore AIS800-64D、UfiSpace S9321-64E。S9321-64EO 加入用於 DCI 的 400G ZR+ 相干光學。 | Edgecore AS9736-64D。 |
| 在設計中的角色 | 800G 的 AI 後端與儲存平面,加上跨站點的相干 DCI。 | 入門型建置以及 400G 前端或管理平面。 |
一套 NOS 的力量
這四個平面與 DCI 連結並非四項產品。它們是同一套作業系統的四種角色:OcNOS-DC 運行 AI 後端、儲存、前端與帶外管理 fabric,加上相干 DCI,並以一套設定模型與一套透過 gNMI 與 OpenConfig 的遙測堆疊。團隊只需學習一套 CLI、一個自動化介面,以及一組適用於每個平面的計數器。
一套維運模型
無論某個埠是朝向 GPU 的後端 leaf、儲存 leaf、前端邊界,還是管理交換器,都套用相同的路由、QoS 與遙測模型。
單一支援合約
單一份 IP Infusion 合約即涵蓋軟體與經驗證的硬體,並在每個平面上提供一個 TAC 與一份 SLA。NOS 供應商與硬體供應商之間不會互相推諉。
一條可持續成長的藍圖
藍圖上規劃:fabric 全域 GLB(OcNOS 7.1)、以延遲為基礎的 ECN(7.1.0),以及 LLR、CBFS 與封包修剪。即將推出的 Tomahawk 6 晶片(BCM78910 / BCM78914,102.4 Tbps,TSMC 3nm)搭載 OcNOS 7.2 版本,並以更高的 radix 延伸相同的設計。從第一天就建好遙測平面,讓這些功能以軟體步驟的形式到位。
AI fabric 架構常見問題
AI 資料中心由哪些 fabric 組成?
每個 fabric 應採用多少超額訂閱比?
如何連接兩座 AI 資料中心?
一套 NOS 能運行所有 fabric 嗎?
每個平面運行哪種硬體?
深入了解,隨身帶走。
產品規格書,以及內容比本頁更為深入的簡明技術下載資料。
OcNOS 800G 無損 AI Fabric
表單簡短。提交後您的 PDF 將立即在新標籤頁中打開。
✓ 正在新標籤頁中打開您的 PDF……
如果未能自動打開,請使用下方連結。
EVPN-VXLAN 資料中心網路
表單簡短。提交後您的 PDF 將立即在新標籤頁中打開。
✓ 正在新標籤頁中打開您的 PDF……
如果未能自動打開,請使用下方連結。
要設計完整的 AI 資料中心嗎?我們會與您一起規劃每個平面。
告訴我們 GPU 規模與工作負載,IP Infusion 工程師便會與您一起為後端、儲存、前端、管理與 DCI 平面進行規模設計,或在 AI Fabric Design Suite 中先從初版佈局開始。
以 OcNOS 設計整套 AI 網狀架構
從商業論證到埠數計算,無論您的建置進行到哪個階段,都能從此接續。