自適應路由 · Flowlet · RoCEv2

動態負載均衡:適用於 AI Fabric 的自適應路由

在 AI 網路上,請使用自適應的動態負載平衡(Dynamic Load Balancing),而非靜態雜湊的 ECMP。 DLB 會在每個流片(flowlet,也就是由封包間間隔所界定的子流量區塊)上重新評估路徑,並運用即時的 ASIC 出口佇列深度與連接埠使用率遙測,使 GPU 集體通訊不再於單一上行鏈路上發生碰撞。它運行於 Broadcom Tomahawk 4 與 5 的交換器 ASIC 之中,無需變更 NIC 或集體通訊函式庫。

Per-flowlet自適應路徑選擇
TH4 + TH5Broadcom Tomahawk 25.6T / 51.2T
0 項 NIC 變更運行於交換器 ASIC 之中
1 SKUOcNOS-DC PLUS,無需附加元件
運作中的自適應路由

葉主幹網路上的自適應路由

一個由四個主幹、兩個葉節點組成的切片,承載 GPU AllReduce 流量。DLB 會即時量測本地出口佇列深度。當 Spine-3 飽和時,葉節點會將下一個流片重新分配到負載較低的主幹上,讓四條上行鏈路都維持平衡。

跨 AI 葉脊 fabric 的動態負載均衡 A four-spine, two-leaf AI fabric. GPU servers attached to the leaves send AllReduce flows. Three spine paths carry balanced flowlets. The fourth spine is congested, and Dynamic Load Balancing re-bins the next flowlet onto a less-loaded spine. Bottom band labels DLB metrics: queue depth, port utilisation, flowlet rebind. Spine-3 congested · next flowlet re-bound to Spine-2 Spine-1 隊列 18% Spine-2 隊列 22% Spine-3 隊列 92% Spine-4 隊列 25% Leaf-1 DLB · flowlet Leaf-2 DLB · flowlet GPU-0 GPU-1 GPU-2 GPU-3 DLB · QUEUE-DEPTH FEEDBACK · FLOWLET REBIND · CONGESTION-AWARE ECMP
為什麼靜態 ECMP 在 AI 網路中會失效

靜態 ECMP 與 DLB 逐項比較

標準的 ECMP 會在流量開始時對 5 元組(5-tuple)進行雜湊,並在該流量的整個生命週期內將其固定。在南北向的網頁流量上,數以百萬計的短暫流量能讓各路徑的使用率趨於平順。但在 AI 網路上,少數幾條 GPU 大流量各自將一整條 400G 或 800G 上行鏈路占用數秒,會造成雜湊極化:部分上行鏈路飽和,而並行的路徑卻閒置。DLB 則會運用即時的 ASIC 遙測,在每個流片上重新評估路徑。

Axis Static ECMP雜湊並固定 DLB自適應,逐流片
路徑決策在流量開始時對 5 元組進行一次雜湊,並在其整個生命週期內將該流量固定。在每個流片邊界重新評估路徑,並將流量移至壅塞程度較低的上行鏈路。
Granularity整條流量。單一次雜湊選擇就主宰了長達數秒的大流量。流片:由微小的封包間間隔所界定的子流量區塊,可安全地重新分配而不會造成重新排序。
壅塞訊號無。雜湊對即時的鏈路狀態毫無所知。即時的 ASIC 出口佇列深度與連接埠使用率遙測,每數微秒重新計算一次。
在 GPU 大流量之下雜湊極化:兩條大流量可能在同一條上行鏈路上碰撞,而另一條卻閒置。飽和的成員會在一個流片內退出候選集合,因此各上行鏈路得以維持平衡。
重新排序風險無;流量被固定,但代價是熱點與尾端延遲的異常值。實務上無;封包間間隔意味著 RoCEv2 與 TCP 都能看到正確的循序傳遞。
NIC / 集體通訊函式庫無需變更;標準行為。無需變更。運行於交換器 ASIC 之中,因此 RoCEv2 NIC 與 xCCL 堆疊完全不受影響。
硬體任何支援 ECMP 的交換器。Broadcom Tomahawk 4(25.6T)與 Tomahawk 5(51.2T),採用 64x400G 與 64x800G 組態。
遙測標準的介面計數器。透過 gNMI 提供逐成員的重新分配計數、流片間隔分布,以及成員品質評分。
實作內部

OcNOS DLB 實現

DLB 並非控制平面上的外掛附加元件。它運行於 Broadcom 的轉送管線之中,依即時的壅塞訊號為每個 ECMP 下一跳評分,並在硬體中重新分配流片,且與 RoCEv2 無損堆疊共同調校。

流片偵測

亞毫秒級間隔計時器

ASIC 原生的流片閒置計時器(典型為 16 至 256 µs)會將長的大流量切分為多個區塊,可安全地噴灑至各路徑而不會造成 TCP 或 RoCEv2 的重新排序。

路徑品質

實時隊列深度反饋

DLB 從 Tomahawk 流水線獲取各出埠的隊列佔用率與鏈路利用率信號,實時為每條 ECMP 下一跳評分。

Re-bind

自適應下一跳選擇

在每個流片邊界都會選出品質最高的成員。成員品質每數微秒重新計算一次,因此飽和的主幹會在一個流片內退出候選集合。

Lossless

與 PFC 和 ECN 協同調優

DLB 與 RoCEv2 無損協議棧(PFC、ECN/DCQCN、緩衝餘量計算)整合,因此 flowlet 重新綁定會在暫停幀向上遊傳播之前完成。

遙測

gNMI 導出

逐成員重綁定計數、flowlet 間隔分布與成員品質評分通過 gNMI dial-out 流式上報,用於閉環織構調優。

硬體

TH4 / TH5 原生

已在 Broadcom Tomahawk 4(25.6T)與 Tomahawk 5(51.2T)主幹平台上,以 64x400G 與 64x800G 的連接埠組態完成驗證,且不會造成軟體快速路徑的效能損失。

自適應路由堆疊的一部分

DLB 在網路中的定位

DLB 是更大型開放 Ethernet 傳輸中,具壅塞感知能力的單跳層。它運行於無損的 RoCEv2 之上,將端到端評分交由全網路 GLB 處理,並在 UEC NIC 上市後保留通往 Ultra Ethernet 的清晰路徑。

底層的無損傳輸

DLB 會在一個 RoCEv2 無損網路 (PFC、ECN、DCQCN)的基礎之上重新分配流片,因此自適應路由與無損 RDMA 是共同調校,而非彼此相互衝突。

接著是全網路評分

DLB 負責為本地的下一跳評分,而 GLB(OcNOS 7.1) 則將此決策延伸至整個葉主幹網路的端到端路徑品質。

支援封包噴灑的傳輸即將到來

DLB 是通往下列技術的自適應路由橋樑 Ultra Ethernet,其封包噴灑與多路徑 RDMA 隨著 UEC 硬體出貨,將相同理念帶入網卡。

在生產環境中

DLB 在生產環境 AI fabric 中帶來的價值

透過讓 flowlet 避開靜態 ECMP 過載的壅塞上行鏈路,DLB 將對稱的 leaf-spine 網狀架構轉變為在 GPU 集合通訊流量下仍保持平衡的架構。

  • 更高的利用率。 Flowlet 重新平衡讓流量避開靜態 ECMP 過載的壅塞上行鏈路,因此妥善運作的網狀架構可在相同硬體上以超過 90% 的使用率為目標,而無需購買更多上行鏈路。
  • 更低的尾延遲。 由於不會出現單條鏈路飽和而其他鏈路閒置的情況,P99.9 集合通信完成時間得以收緊。
  • 更快的訓練。 減少 GPU 等待最慢 rank 的空閒時間,意味著在 AllReduce 密集型工作負載上實現可量化的實際運行時間提升。
  • 無需更換 NIC。 DLB 位於交換器 ASIC 中。現有的 RoCEv2 網卡與 xCCL(NCCL、RCCL、oneCCL)集合通訊堆疊無需變更程式碼即可獲得正確的循序傳遞。
  • 一張許可證。 DLB 是 OcNOS-DC PLUS SKU 的一部分:同一鏡像、同一支持合同,無需按功能額外付費。
IP Infusion 的觀點

自適應路由是乙太網路 AI 網狀架構的基本要件

靜態 ECMP 是為南北向網路流量而設計。一旦網狀架構承載 GPU 集合通訊,自適應路由便是平衡上行鏈路與訓練工作停滯之間的差別,而 OcNOS 如今就能在開放硬體上提供此能力。

僅靠 ECMP 並不足夠

少數幾條大象流即可擊敗靜態雜湊。雜湊極化使部分上行鏈路飽和,而並行路徑卻閒置。

DLB 弭平路由落差

以 flowlet 為單位、具壅塞感知的路徑選擇,讓乙太網路網狀架構在集合通訊流量下保持平衡,這正是 InfiniBand 曾佔優勢的面向之一。

OcNOS 是推手

今日的 DLB、下一步的 GLB、隨網卡出貨的 UEC。單一 NOS 執行於 Edgecore 與 UfiSpace 等廠商經驗證的開放硬體上,無需變更網卡或集合通訊函式庫。

常見問題

動態負載平衡,完整解答

什麼是 flowlet,DLB 為何要使用它?
flowlet 是由較小的封包間隔所劃分的子流片段。DLB 在每個 flowlet 邊界處重新評估路徑,而非固定整條流,因此可將流量轉移至壅塞較輕的 uplink,而不會引發 RoCEv2 或 TCP 的亂序。
DLB 與靜態 ECMP 有何不同?
靜態 ECMP 在流量開始時對 5-tuple 進行雜湊,並在其生命週期內將流量固定於同一路徑,因此兩條 GPU 大象流可能在同一條上行鏈路上碰撞,而另一條卻閒置。此雜湊極化使部分上行鏈路飽和,而並行路徑則閒置。DLB 運用即時的佇列深度與連接埠使用率,即時為每個 next-hop 評分,並將 flowlet 重新綁定至最佳路徑。
DLB是否需要新的NIC或對我的集合運算函式庫進行變更?
不需要。DLB 執行於交換器 ASIC 內,因此現有的 RoCEv2 NIC 以及 xCCL(NCCL、RCCL、oneCCL)集合運算堆疊無需變更程式碼即可取得正確的按序交付。
哪些硬體支援 OcNOS DLB?
DLB 在 Broadcom Tomahawk 4(25.6T)與 Tomahawk 5(51.2T)平台的 64x400G 與 64x800G 組態上受支援,並包含於 OcNOS-DC PLUS SKU 中,無需按功能付費的附加項。

正在為您的 GPU 網狀架構調校 DLB?取得針對工作負載的專屬檢視

告訴我們 GPU 規模與集合通訊模式,IP Infusion 工程師將與您一同調校 flowlet 計時器與路徑評分;或先透過 AI Fabric Design Suite 取得初步的 leaf-spine 佈局。