網路定義 · RDMA · RoCEv2

什麼是 AI Fabric?

AI fabric 是 GPU 後端(scale-out)網路,在分散式訓練與推論期間承載 GPU 之間的 RDMA 流量。 It connects every GPU NIC across servers and pods using leaf and spine switches in rail-optimized and Clos topologies, and it runs a lossless Ethernet transport (RoCEv2 with PFC and ECN) so no packet is dropped under load. Because GPUs exchange data in lockstep collectives, the fabric's tail latency sets job completion time. This is the networking sense, not the enterprise "data fabric" used in data management. OcNOS-DC provides this fabric on Broadcom Tomahawk 5 hardware.

RoCEv2無損乙太網路傳輸
51.2 TbpsTomahawk 5, 64x800G
16,000+GPU,3 階 Clos
OcNOS-DC開放硬體上的一套 NOS
兩種含義,一個詞

網路意義,而非「data fabric」

兩個不同領域使用「fabric」這個詞。data fabric 是一種用於在整個企業內統一與治理資料的軟體架構。而 AI fabric,也就是本頁的主題,是一個實體網路:搬移 GPU 之間 RDMA 流量的佈線、交換器與傳輸。當 AI 基礎設施團隊說「fabric 是瓶頸」時,他們指的正是這個網路,也就是決定訓練作業耗時多久的那一個。

  • Data fabric。 一種用於跨系統統一與治理資料的企業資料管理架構。是軟體,而非佈線。
  • AI fabric. 在訓練與推論期間承載 GPU 之間 RDMA 的實體 GPU 後端網路。本頁談的就是這個含義。
  • 為何重要。 AI fabric 是決定作業完成時間的那一個,因此它經過工程設計以維持無損且負載均勻。
fabric 如何建構

Rail、Clos,以及一種不會丟棄封包的傳輸

AI fabric 是針對一種流量模式調校的 leaf-spine(Clos)網路:許多 GPU 同時彼此傳送大型資料流。三項設計選擇定義了它,而每一項都是為了保護作業完成時間而存在。

拓撲

先 rail-optimized,再 3 階 Clos

Each of a GPU server's 8 NICs connects to its own 專屬 rail leaf,讓主要的同 rail AllReduce 流量留在同一個 leaf 上。超出單一 pod 後,設計會延伸為 leaf、spine 與 super-spine 的 3 階 Clos。

Transport

無損 RoCEv2

GPU 以 RDMA 搬移資料,而 RDMA 在封包被丟棄時表現不佳。 PFC 可防止交換器佇列溢位,而 ECN 會提早標記封包,使傳送端 NIC 在丟包發生前先降速。這個組合在乙太網路上承載 RoCEv2。

Behaviour

為何必須無損

OcNOS-DC 為此 fabric 提供 PFC(含 L3 上 PFC)、ECN、Dynamic ECN、WRED,以及動態負載平衡以維持每條路徑負載均勻,因為尾端資料流決定整個作業何時完成。

這如何契合

乙太網路已足夠,而交換器決定上限

AI fabric 如今是乙太網路。它能達到的規模,取決於其底層的交換器晶片以及你所設計的 GPU 數量。

  • 乙太網路已足夠。 搭配 PFC 與 ECN 的 RoCEv2 可在標準的多廠商硬體上提供無損 RDMA。Meta 已公開一個建構於乙太網路上、含 24,000 個 GPU 的訓練叢集。
  • 交換器決定上限。 OcNOS-DC 運行於 Broadcom Tomahawk 5(51.2 Tbps,64x800G)平台,例如 Edgecore AIS800-64D 與 UfiSpace S9321-64E,正是 800G GPU fabric 所需的密度。
  • 依 GPU 數量設計。 Rail-optimized single pod up to roughly 1,000 GPUs, then a 3-stage Clos to 16,000+ and up to about 65,536 at the fat-tree limit.
常見問題

什麼是 AI Fabric 常見問題

什麼是AI組網?
在網路領域,AI fabric 是 GPU 後端(scale-out)網路,在分散式訓練與推論期間承載 GPU 之間的 RDMA 流量。它連接每個伺服器與 pod 上的 GPU NIC,讓 AllReduce 這類集合作業能以最慢連結所允許的速度盡快完成。它由 rail-optimized 與 Clos 拓撲中的 leaf 與 spine 交換器建構,並運行無損乙太網路傳輸(搭配 PFC 與 ECN 的 RoCEv2)。OcNOS-DC 在 Broadcom Tomahawk 5 硬體上提供該 fabric。
AI fabric 與 data fabric 相同嗎?
不同。它們是共用一個詞的不同術語。data fabric 是一種用於跨系統統一與治理資料的企業資料管理架構。而 AI fabric,在此處所用的網路意義上,是一個在 GPU 之間搬移 RDMA 流量的實體 GPU 後端網路。本頁談的是網路含義。
為何 AI fabric 決定作業完成時間?
GPU 訓練以同步方式運行。每一步之後,GPU 會在一次集合作業中交換梯度,而每個 GPU 都要等該次交換完成,下一步才會開始。若一條連結停滯或丟棄封包,整個作業就得等待。由於 fabric 承載每一次這樣的交換,是其尾端延遲、而非平均延遲,決定了一次訓練作業耗時多久,這也是 fabric 經過工程設計以維持無損且負載均勻的原因。
我需要 InfiniBand 嗎,還是乙太網路對 AI fabric 就已足夠?
乙太網路如今是一流的 AI fabric 傳輸。搭配 PFC 與 ECN 的 RoCEv2 可在標準的多廠商硬體上提供無損 RDMA,而 Meta 已公開一個建構於乙太網路上、含 24,000 個 GPU 的訓練叢集。OcNOS-DC 如今運行該 RoCEv2 fabric,並對齊 Ultra Ethernet Consortium 1.0 fabric profile,以支援下一代端點。

要建構 AI fabric 嗎?讓我們一起做規模設計。

告訴我們 GPU 規模與工作負載,IP Infusion 工程師便會在運行 OcNOS-DC 的開放 Tomahawk 5 硬體上,與您一起計算拓撲與埠數。