AI fabric 設計工具

端到端、廠商中立地設計無阻塞的 RoCEv2 GPU fabric。對 leaf 與 spine 交換器進行選型,規劃光收發模組與纜線數量,針對您的叢集比較 InfiniBand 與 Ethernet,並取得 lossless 壅塞設定檔。本工具僅進行網路設計,不提供成本估算或物料清單。

Step 1

為 GPU fabric 進行規模估算

選擇一個起始規模,或輸入您自己的GPU數量、連接埠速率與交換晶片。該工具可對折疊式兩層leaf-spine pod進行規模估算,並在叢集跨入三層規模時予以提示。

SPINE Spine 1Spine 2Spine 3 LEAF Leaf 1Leaf 2Leaf 3Leaf 4 GPU SERVERS
leaf 交換器
spine交換器
交換器總數

上述數量假設採用折疊式 leaf-spine (Clos) fabric,每個 GPU 配備一張 fabric NIC,每個 leaf 將其連接埠在 GPU 與 spine 上行鏈路之間分配。rail-optimized 佈線(每個 GPU 多張 NIC)改變的是流量的區域性,而非這些交換器數量。請參見 AI fabric拓撲參考設計 適用於 rail-optimized 與三層佈局。

Step 2

元件摘要

針對已定量設計的 fabric 鏈路、收發器與線纜數量。這些僅為規劃資料,並非物料清單、報價或定價。

ComponentBasisQuantity
GPU 側的鏈路GPUs × 1 NIC
leaf到spine的fabric鏈路leaves × uplinks
fabric 光收發器links × 2 ends
fabric纜線每條鏈路 1 個

按傳輸距離選擇的介質,視佈線情況而定:最長 3 m 採用 DAC 或 AEC,最長 50 至 100 m 採用 AOC 或 SR,最長 500 m 採用 DR(主力選擇),最長 2 km 採用 FR。僅列出傳輸距離等級。不含價格、SKU 或廠商料號。在三層設計中,請在上述數量之外,額外加入 spine 至 super-spine 的鏈路。

Decision

InfiniBand 與乙太網對比

這是一份涵蓋六個因素的廠商中立計分卡。它會根據您的輸入顯示每個因素傾向於哪一方及其原因。此處依設計並無唯一贏家。請將其用作設計審查的輸入依據,而非最終建議。

FactorInfiniBandEthernet / RoCEv2Ultra Ethernet (trajectory)
尖峰效能傾向 InfiniBand以較低的調校投入即可獲得百分之十五左右的原始吞吐量優勢,另外還有 SHARP 網路內縮減,可將集合運算從 GPU 卸載。經過適當調校即可與 InfiniBand 持平。一個 24,000 GPU 的 RoCEv2 訓練叢集已在生產環境中以對等效能運行。差距在於調校投入,而非效能上限。增加 packet spray 與 NIC 側重新排序,以降低尾端延遲並減少對 PFC 的依賴,從而縮小開箱即用的差距。
Cost偏向 Ethernet在 fabric 規模下會帶來明顯的溢價,相較於同等 Ethernet 通常處於 30 至 60 個百分點的區間。merchant-silicon交換器加上廣泛的光學元件供應鏈,通常使其成為每連接埠成本更低的fabric。與Ethernet相同的開放merchant silicon經濟性。
開放性偏向 Ethernet從交換器、NIC到管理器端到端均為單一廠商堆疊,因此多廠商採購受到限制。開放且多供應商:來自眾多供應商的基於標準的交換器、NIC與NOS,保留供應鏈選擇的彈性。強化開放方向的產業聯盟標準(UEC 1.0,2025 年)。
維運的簡潔性neutralUFM提供單一的專用fabric管理器,對於不具備深厚RDMA人才的團隊而言是一套開箱即用的方案。可借助龐大的Ethernet人才儲備與標準工具,但lossless RoCEv2需要審慎的端到端調校。旨在減輕調校負擔,使 Ethernet 趨向類似 IB 的開箱即用表現。
多租戶與融合偏向 Ethernet通常是一個專用的後端孤島,不具備原生多租戶隔離或儲存融合能力。單一收斂的 Ethernet fabric 即可在標準租戶隔離下承載後端、儲存與前端流量。在單一開放fabric上延展converged-Ethernet的方向。
Trajectory偏向 Ethernet成熟穩定,在低度調校下即具備領先效能,但受制於單一廠商的路線圖。至 2025 年年中,Ethernet 已轉而主導 AI back-end 部署,並獲得廣泛的生態系統動能。UEC 1.0 (2025) 是一項明確針對 AI 與 HPC back-end fabric 的多廠商規範。

假設條件:效能是在完成調校的前提下進行比較(未調校的 Ethernet 表現落後,充分調校的 Ethernet 可達到同等水準);成本以區間形式呈現,而非具體金額;開放性指多廠商採購,而非品質評斷;Ultra Ethernet 反映的是 2025 年及之後的方向,而非已出貨產品。集合運算調校泛指 xCCL 函式庫。以上內容用於輔助決策;fabric 選擇請與 IP Infusion 工程師共同驗證。

配置檔案

RoCEv2 lossless 設定檔

RoCEv2 並非單一的交換器特性。它是由 PFC、ECN 與 ETS 組成的設定組合,其中 DCQCN 承擔穩態工作,PFC 作為最後防線。本工具會針對您的設計推薦相應機制及其套用順序。它不會給出門檻數值,也不會對任何設備進行操作。

Mechanism在 lossless 設定檔中的作用OcNOS 可用性
PFC為 RoCE 類別提供無丟棄保證。這是最後的兜底機制,而非主要的控制手段。全部 4 個 AI 平台
ECN提前標記壅塞,使發送方在佇列溢出前降低速率。將其標記點調至 PFC 觸發點以下。全部 4 個 AI 平台
DCQCN (ECN + PFC)穩態下的主要控制手段。ECN 標記驅動 NIC 側的 DCQCN 反應,PFC 予以兜底。它是複合機制,而非獨立功能。全部 4 個 AI 平台
ETS提供頻寬保證與類別隔離,使 lossless 類別不會因 best-effort 流量而資源匱乏。全部 4 個 AI 平台
PFC 死結看門狗偵測並解除PFC pause死結或風暴狀況,是PFC後備機制的安全網。全部 4 個,OcNOS 7.0
DLB (動態負載平衡)分散在靜態 ECMP 下會發生碰撞的大流量(elephant)RoCE 流。將 fabric 使用率從大約 55% 提升至 90% 以上。全部 4 個 AI 平台
動態 ECN根據即時佇列狀況調整 ECN 標記,隨著負載變化減少人工重新調校。僅限TH5,OcNOS 7.0
DLB 反應式 / 隨機用於實現更緊密流量分散的進階 DLB 放置模式。在 TH4 上,請使用標準 DLB。僅限TH5,OcNOS 7.0
GLB (Global Load Balancing)超越本地 DLB 決策的 fabric 全域負載平衡。路線圖,OcNOS 7.1版本序列
Ultra Ethernet採用 NIC 側重新排序並降低 PFC 依賴的 packet spray,這是通往 lossless AI Ethernet 的發展路徑。藍圖、UEC 設定檔

僅供參考。這些建議不會下發至任何裝置,此處也不會產生任何門檻值。可用性以 OcNOS-DC 為準。 功能矩陣 and 硬體兼容性列表。請在部署前針對您所選的平台與 OcNOS 版本進行驗證。

Estimate

fabric 功耗

經過規模測算的設計中,fabric 交換器的典型功率範圍。僅為範圍值,且為滿載光模組的情形。網路交換器僅佔叢集總功耗的一小部分,功耗主要由 GPU 主導。

kW 典型低值
kW(滿載)

散熱:後門散熱或直接液冷通常在每機櫃約 30 至 40 kW 以上時才會考量,這取決於 GPU 伺服器密度,而非網路。此為參考指引,並非計算得出的熱負載。交換器功耗範圍為已裝配光模組的 51.2T (Tomahawk 5) 與 25.6T (Tomahawk 4) 等級設備的典型值;請以各平台資料表中的確切數值為準。

相符的 OcNOS-DC 平台

該 fabric 在開放的 Broadcom Tomahawk 硬體上運行單一 OcNOS-DC 映像。以下是其設計所針對的受支援 800G 與 400G 平台。

本工具僅提供供規劃用途的結構性網路設計估算。它不構成效能保證、物料清單或成本估算。實際設計取決於 rail 最佳化、每 GPU 的 NIC 數量、佈線以及故障網域的選擇。GPU 數量為依 Clos radix 計算得出的參考設計上限值,而非實測值。Broadcom 與 Tomahawk 為 Broadcom Inc. 的商標;其他名稱為其各自所有者的商標。

資源

AI Fabric參考設計

取得參考設計 PDF:包含拓撲、交換器數量、元件彙總,以及一份 RoCEv2 lossless 初始設定檔。

下載 PDF
常見問題

常見問題

如何為 GPU 叢集規劃 leaf-spine fabric 的規模?
在非阻塞的兩層leaf-spine fabric中,每台leaf交換器將一半連接埠用於GPU,另一半用於spine上行鏈路。leaf交換器的數量為GPU數量除以每台leaf面向GPU的連接埠數,spine交換器的數量則為在不產生超額訂閱的情況下承載每條leaf上行鏈路所需的最少數量。單一leaf叢集無需spine層。本工具針對400G或800G的Broadcom Tomahawk 4與Tomahawk 5計算上述數量。
什麼是rail-optimized拓撲?
rail-optimized 是指每台 GPU 伺服器配備多張 NIC(通常為8張,每條 rail 一張),且每條 rail 各自歸屬於自己的 leaf,從而使各伺服器上相同索引的 GPU 落到同一 leaf 上,占主導地位的 AllReduce 流量得以保持在本地。這是一種疊加在 1:1 無阻塞 fabric 之上的佈線與流量局部性原則。它改變的是流量的走向,而非 leaf 與 spine 交換器的數量。
一個 AI fabric 需要多少個光收發器?
每條點對點 fabric 鏈路兩端各使用一個收發器,共兩個,因此收發器數量為 leaf-to-spine 鏈路數量的兩倍。鏈路數量等於 leaf 數量乘以其 uplink 數量,也等於 spine 數量乘以其 downlink 數量。本工具提供這些數量。它們僅為規劃資料,並非物料清單或報價。
對於 AI 而言,RoCEv2 與 InfiniBand 何者更優?
兩者並非在所有情況下皆較優。InfiniBand 在較低的調校投入下即可提供出色的原始效能,並配備統一的 fabric 管理器。採用 RoCEv2 的 Ethernet 在完成調校後即可達到同等效能,並通常在成本、開放性、多租戶與產業趨勢方面勝出。適合的 fabric 取決於叢集規模、人力配置與既有技術堆疊。本工具會依據您的輸入權衡各項因素,隨後將決策交由設計審查處理。
如何為 RoCEv2 打造 lossless 的 AI fabric?
lossless RoCEv2 由三種協同運作的機制構成:用於 no-drop 類別的 PFC、用於早期壅塞訊令的 ECN,以及用於類別隔離的 ETS。DCQCN 即 ECN 加 PFC,是穩態下的主要控制手段,而 PFC 則作為最後的兜底,因此應將 ECN 標記門檻調至 PFC 門檻以下。請保持 PFC、ECN 與 CoS 端到端一致。OcNOS-DC 在 Tomahawk AI 平台上支援這些機制。
同一套 OcNOS 映像是否可在 fabric 中的每台交換器上執行?
是的。每台 leaf 與 spine 交換器都在開放的 Tomahawk 硬體上執行同一套 OcNOS-DC 映像,具備 RoCEv2、PFC 和 ECN 以及動態負載平衡。無論設計最終需要多少台交換器,這都使 fabric 保持在同一套作業系統與同一份支援合約之下。
AI 網路

Design the whole AI fabric with OcNOS

From the business case to the port-count maths, pick up wherever you are in the build.