RoCE 與 InfiniBand 於 AI 叢集之比較
RoCEv2 在開放的多廠商 Ethernet 上執行 RDMA;InfiniBand 則是單一廠商的無損網路。 RoCEv2 透過 PFC 與 ECN 維持無損,並以 DCQCN 控制壅塞,而 InfiniBand 則是透過信用式流量控制在設計上即為無損。對多數 AI 工作負載而言,搭配 RoCEv2 的 Ethernet 如今已能與 InfiniBand 匹敵,同時保有硬體選擇的彈性。本頁將逐項比較兩者。
相同的 GPU,兩種維持無損的方式
左側:透過 Ethernet 的 RoCEv2 以逐跳 PFC 暫停、交換器上的 ECN 標記,以及傳送端 NIC 的 DCQCN 速率控制,讓佇列維持較淺。右側:InfiniBand 採用信用式流量控制,只有在接收端已公告緩衝區信用額度時才會傳送。兩者皆可避免丟棄;一者運行於開放的多廠商 Ethernet 上,另一者則運行於單一廠商的網路上。
RoCE 與 InfiniBand 逐項比較
RoCE 是在融合式 Ethernet 上運行的 RDMA;與 AI 相關的版本是 RoCEv2,它將 RDMA 封裝於目的地連接埠 4791 的 UDP/IP 之中,使流量可在 Layer 3 Ethernet 網路上進行路由。InfiniBand 則是來自 InfiniBand Trade Association 的專用互連技術,透過信用式流量控制在架構上即為無損。對 AI 叢集而言,實務上的問題在於:哪一種傳輸方式既能滿足工作負載,又能讓成本、供應鏈與維運維持在合理範圍。
| Axis | RoCE透過 Ethernet 的 RoCEv2,開放 | InfiniBand單一廠商網路 |
|---|---|---|
| Transport & standard | 在 UDP/IP 上運行的 RDMA(RoCEv2, IBTA),可在目的地 UDP 連接埠 4791 上進行 Layer 3 路由。運行於標準的 IEEE Ethernet 之上。 | 專用的 InfiniBand 鏈路層與傳輸層(IBTA),搭配專屬的交換器與主機通道介面卡(host channel adapter)。 |
| 如何維持無損 | 以 PFC 進行逐跳流量控制,再加上 ECN 與 DCQCN 進行端到端壅塞控制,讓交換器佇列維持較淺,使 RDMA 避免丟棄封包。 | 信用式流量控制:傳送端只會依據接收端所公告的緩衝區信用額度進行傳輸,因此網路在設計上即為無損。 |
| 生態系統 | 每一層皆為開放且多廠商:交換器 ASIC、交換器、NIC、NOS 與光學模組皆來自獨立供應商。 | 在 NIC 與交換器晶片方面實質上為單一廠商;網路、介面卡與管理皆以單一堆疊的形式提供。 |
| 交換器晶片選擇 | Broadcom Tomahawk 5(51.2 Tbps, 64x800G)與 Tomahawk 4(25.6 Tbps, 64x400G),可用於 Edgecore、UfiSpace 等多家平台。 | 晶片僅來自 InfiniBand 廠商;不存在獨立的 ASIC 或交換器供應。 |
| 壅塞控制 | 端到端 DCQCN:交換器標記 ECN,傳送端 NIC 則降低其速率。自適應負載平衡(DLB)會分散流量,並在本地壅塞時重新平衡。 | 信用式流量控制,並將自適應路由內建於規範之中。 |
| Scale | On Tomahawk 5, a 2-tier fabric reaches roughly 2,048 GPUs at 1:1 (toward 8,000+ with 800G breakout); a 3-stage Clos extends to 16,000+ and up to about 65,536 endpoints. | 透過胖樹拓撲進行擴充,並由單一廠商網路內的集中式子網路管理員(subnet manager)加以管理。 |
| Operations & tooling | 標準的 Ethernet 維運:BGP、EVPN、gNMI/OpenConfig 遙測,以及在整個資料中心通用的相同自動化工具(Ansible、NETCONF)。 | 專門的 InfiniBand 工具與子網路管理員,與資料中心其餘部分的維運模式各自獨立。 |
| 廠商鎖定 | 本質上不存在:可自由混搭硬體與軟體,並為供應鏈建立第二來源。 | 高:NIC、交換器、纜線與管理通常都來自單一廠商。 |
| Cost trend | 以 400G 與 800G 執行 OcNOS-DC 的開放硬體主幹,其成本明顯低於單一廠商網路,而且隨著連接埠速率提升,差距會進一步擴大。 | 在同等容量下,單一廠商的定價會帶有溢價。 |
InfiniBand 是 InfiniBand Trade Association 的商標。NVIDIA 與 Mellanox 是其各自擁有者的商標。本比較僅供資訊參考之用,並不暗示任何關聯或背書。
各自的制勝場景
正確的答案取決於工作負載。若需求是絕對的延遲下限,請選擇 InfiniBand;若決策取決於維運模式、成本或跨站點的傳輸距離,則請選擇 RoCE。
延遲下限就是規格要求
在緊密耦合的 HPC 模擬中,絕對的 NIC 對 NIC 延遲下限比總體擁有成本更為重要;以及在可接受單一廠商堆疊的專屬單租戶叢集中。
維運與供應鏈至關重要
多租戶的 GPU 即服務(GPU-as-a-Service)以及 AI 後端,與資料中心其餘部分共用同一套維運模式、同一套工具堆疊,以及多廠商的供應鏈。
每個 GPU 的成本是關鍵門檻
開放硬體主幹搭配 OcNOS-DC,可消除單一廠商網路的溢價。在數千個 GPU 的建置中,這在硬體預算中占有相當可觀的比例。
網狀架構橫跨多個資料中心
Ethernet 可透過 400G ZR/ZR+ 相干光學模組,自然地跨越機房與區域延伸,而無需另設長途閘道層。
OcNOS-DC 如何實現 RoCEv2 路徑
OcNOS-DC 提供 RoCEv2 所需的無損 Ethernet 基礎。交換器負責提供避免遺失與壅塞控制的基本機制;RoCEv2 則是運行於 NIC 上的傳輸方式。這些皆為 OcNOS-DC 今日已驗證的交換器功能。
PFC and ECN
優先權流量控制(Priority Flow Control),包括在 Layer 3 上搭配 DCBX/LLDP 的 PFC-with-QoS,以及 ECN 與 Dynamic ECN,讓 RDMA 流量維持較淺的佇列而不丟棄封包。
DCQCN 標記
交換器會標記 ECN,讓端到端的 NIC 加交換器的 DCQCN 迴路 得以限制傳送端的速率。ETS 與 WRED 則負責整形並管理承載 RDMA 的佇列。
DLB 與 RTAG7
動態負載均衡 (包含 Reactive Path Rebalance 與 Random Flow)搭配 RTAG7 雜湊,可分散集體通訊流量並在本地壅塞時重新平衡。
PFC 死鎖保護
PFC 死結偵測與復原(Deadlock Detection and Recovery) 再加上緩衝區調校,可在 PFC 可能造成的暫停擴散下,維持無損網路的穩定。
與 UEC 1.0 對齊
IP Infusion 是 Ultra Ethernet Consortium 的貢獻成員,且 OcNOS-DC 與 UEC 1.0 網路配置檔案對齊,因此在具備 UEC 能力的 NIC 上市後,網路可延續沿用。對齊並不等同於認證聲明。
晶片選擇是開放的:OcNOS-DC 可在採用 Broadcom Tomahawk 5 的 Edgecore AIS800-64D 與 UfiSpace S9321-64E / S9321-64EO(-64EO 額外提供 400G ZR+)上執行,也可在採用 Tomahawk 4 的 Edgecore AS9736-64D 上執行,這些皆為針對 RoCEv2 調校的晶片內建與共用緩衝區平台。單一份 IP Infusion 合約即涵蓋軟體與驗證過的硬體,並提供單一 TAC 與單一 SLA。
為何眾多業者將 AI 後端轉向 Ethernet
這項轉變在維運與經濟層面上的意義,遠大於單純的延遲。在大型建置中,有三項因素會迅速累積效益:與資料中心其餘部分共用的單一網路模式、多廠商的供應鏈,以及 400G 與 800G 下更低的每連接埠成本。
這樣的規模已在實務現場獲得驗證。Meta 曾描述在一個 24,000-GPU 叢集上,透過 RoCE Ethernet 網路訓練其最大型的模型,而這樣的規模過去一度被認為必須採用 InfiniBand。Tomahawk 4 與 Tomahawk 5 上的自適應負載平衡會依即時壅塞重新分配流量,因此在靜態雜湊會使流量受困之處,運作良好的網路可將使用率目標設定在 90% 以上。90% 是設計目標,而非實測保證。
InfiniBand 仍存的優勢,也就是更低的絕對延遲下限,對於一組緊密耦合的 HPC 工作負載而言仍然重要。但對於大規模下多數的分散式訓練與推論集體通訊而言,正確調校的 RoCEv2 網路已低於會改變作業完成時間的門檻,這正是為何維運與經濟上的考量如今決定了多數新的 AI 後端建置。
- 與資料中心其餘部分共用的單一網路模式,讓技能與工具得以延續沿用。
- 多廠商的供應鏈,讓您能為晶片、交換器、NIC 與光學模組建立第二來源。
- 400G 與 800G 下更低的每連接埠成本,釋出資金以投入更多 GPU、更大的儲存層,或第二座站點。
兩者皆為有效選擇,而多數新的 AI 後端最終選擇 Ethernet
InfiniBand 保有更低的絕對延遲下限,而一組緊密耦合的 HPC 工作負載將持續為此付出代價。但對多數 AI 後端建置而言,維運與經濟上的考量會傾向於選擇在開放 Ethernet 上運行的 RoCEv2。
兩者皆為有效選擇
InfiniBand 保有更低的絕對延遲下限,而一組緊密耦合的 HPC 工作負載將持續為此付出代價。
RoCEv2 已為 AI 縮小了差距
只要正確設定 PFC、ECN、DCQCN 與自適應負載平衡,Ethernet 在多數分散式訓練集體通訊上即可與 InfiniBand 匹敵,同時保有硬體選擇的彈性。
決策通常取決於維運
單一網路模式、多廠商的供應鏈,以及 400G 與 800G 下更低的每連接埠成本,決定了多數新的 AI 後端建置。
OcNOS-DC 是開放之路
今日提供已驗證的 RoCEv2 基本機制,明日與 UEC 1.0 對齊,運行於來自 Edgecore 與 UfiSpace 的驗證過開放硬體之上,並涵蓋於單一合約、單一 TAC 與單一 SLA 之下。
取得 AI Fabric 參考設計
The full PDF: lossless RoCEv2 topology, switch and transceiver counts, validated platforms, and a DCQCN starting profile on OcNOS-DC.
取得 AI Fabric 參考設計
簡短表單:提交後 PDF 將立即開始下載。
✓ 正在新標籤頁中打開您的 PDF……
如果未能自動打開,請使用下方連結。
RoCE 與 InfiniBand 常見問題
RoCE 與 InfiniBand 有何差異?
在 AI 應用上,Ethernet 與 InfiniBand 一樣快嗎?
什麼是 RoCEv2?
RoCE 需要無損網路嗎?
我可以在開放交換器上運行 RoCE 嗎?
那 Ultra Ethernet 又如何?
深入了解,隨身帶走。
產品規格書,以及內容比本頁更為深入的簡明技術下載資料。
OcNOS 800G 無損 AI Fabric
表單簡短。提交後您的 PDF 將立即在新標籤頁中打開。
✓ 正在新標籤頁中打開您的 PDF……
如果未能自動打開,請使用下方連結。
EVPN-VXLAN 資料中心網路
表單簡短。提交後您的 PDF 將立即在新標籤頁中打開。
✓ 正在新標籤頁中打開您的 PDF……
如果未能自動打開,請使用下方連結。
正在評估 RoCEv2 網路與 InfiniBand 的規模比較嗎?讓我們一起進行針對工作負載的精算
只要告訴我們工作負載與 GPU 規模,IP Infusion 的工程師就會與您一同進行數字試算,或者您也可以先在 AI Fabric Design Suite 中建立初步的葉主幹配置。
以 OcNOS 設計整套 AI 網狀架構
從商業論證到埠數計算,無論您的建置進行到哪個階段,都能從此接續。