RoCEv2 · PFC / ECN · DCQCN

RoCE 與 InfiniBand 於 AI 叢集之比較

RoCEv2 在開放的多廠商 Ethernet 上執行 RDMA;InfiniBand 則是單一廠商的無損網路。 RoCEv2 透過 PFC 與 ECN 維持無損,並以 DCQCN 控制壅塞,而 InfiniBand 則是透過信用式流量控制在設計上即為無損。對多數 AI 工作負載而言,搭配 RoCEv2 的 Ethernet 如今已能與 InfiniBand 匹敵,同時保有硬體選擇的彈性。本頁將逐項比較兩者。

UDP 4791可在 Layer 3 路由的 RDMA
最高 800G開放的 RoCEv2 網路
1 contractOcNOS-DC + 驗證過的硬體
600+OcNOS 上的電信業者網路
兩種網路,兩種維持無損的方式

相同的 GPU,兩種維持無損的方式

左側:透過 Ethernet 的 RoCEv2 以逐跳 PFC 暫停、交換器上的 ECN 標記,以及傳送端 NIC 的 DCQCN 速率控制,讓佇列維持較淺。右側:InfiniBand 採用信用式流量控制,只有在接收端已公告緩衝區信用額度時才會傳送。兩者皆可避免丟棄;一者運行於開放的多廠商 Ethernet 上,另一者則運行於單一廠商的網路上。

RoCEv2 PFC/ECN/DCQCN loop versus InfiniBand credit-based flow control Two side-by-side diagrams. Left: a sending GPU NIC and a receiving GPU NIC connected through an Ethernet switch running OcNOS-DC. PFC pause acts hop-by-hop, the switch marks ECN on congestion, and a DCQCN signal returns to the sending NIC to lower its rate. Right: an InfiniBand switch and adapter exchanging buffer credits, so a sender transmits only when the receiver has advertised credit. Bottom band contrasts open multi-vendor Ethernet with a single-vendor InfiniBand fabric. RoCEv2 · OPEN ETHERNET INFINIBAND · SINGLE-VENDOR GPU NICsender SwitchOcNOS-DC · TH5 GPU NICreceiver ECN mark PFC pause (hop-by-hop) DCQCN rate control to sender PFC + ECN keep the fabric lossless · DCQCN controls congestion IB Switchsubnet manager GPU HCAIB adapter data (only if credits > 0) buffer credits Credit-based flow control · lossless by design · single ecosystem OPEN MULTI-VENDOR ETHERNET vs SINGLE-VENDOR INFINIBAND FABRIC
兩者比較

RoCE 與 InfiniBand 逐項比較

RoCE 是在融合式 Ethernet 上運行的 RDMA;與 AI 相關的版本是 RoCEv2,它將 RDMA 封裝於目的地連接埠 4791 的 UDP/IP 之中,使流量可在 Layer 3 Ethernet 網路上進行路由。InfiniBand 則是來自 InfiniBand Trade Association 的專用互連技術,透過信用式流量控制在架構上即為無損。對 AI 叢集而言,實務上的問題在於:哪一種傳輸方式既能滿足工作負載,又能讓成本、供應鏈與維運維持在合理範圍。

Axis RoCE透過 Ethernet 的 RoCEv2,開放 InfiniBand單一廠商網路
Transport & standard在 UDP/IP 上運行的 RDMA(RoCEv2, IBTA),可在目的地 UDP 連接埠 4791 上進行 Layer 3 路由。運行於標準的 IEEE Ethernet 之上。專用的 InfiniBand 鏈路層與傳輸層(IBTA),搭配專屬的交換器與主機通道介面卡(host channel adapter)。
如何維持無損以 PFC 進行逐跳流量控制,再加上 ECN 與 DCQCN 進行端到端壅塞控制,讓交換器佇列維持較淺,使 RDMA 避免丟棄封包。信用式流量控制:傳送端只會依據接收端所公告的緩衝區信用額度進行傳輸,因此網路在設計上即為無損。
生態系統每一層皆為開放且多廠商:交換器 ASIC、交換器、NIC、NOS 與光學模組皆來自獨立供應商。在 NIC 與交換器晶片方面實質上為單一廠商;網路、介面卡與管理皆以單一堆疊的形式提供。
交換器晶片選擇Broadcom Tomahawk 5(51.2 Tbps, 64x800G)與 Tomahawk 4(25.6 Tbps, 64x400G),可用於 Edgecore、UfiSpace 等多家平台。晶片僅來自 InfiniBand 廠商;不存在獨立的 ASIC 或交換器供應。
壅塞控制端到端 DCQCN:交換器標記 ECN,傳送端 NIC 則降低其速率。自適應負載平衡(DLB)會分散流量,並在本地壅塞時重新平衡。信用式流量控制,並將自適應路由內建於規範之中。
ScaleOn Tomahawk 5, a 2-tier fabric reaches roughly 2,048 GPUs at 1:1 (toward 8,000+ with 800G breakout); a 3-stage Clos extends to 16,000+ and up to about 65,536 endpoints.透過胖樹拓撲進行擴充,並由單一廠商網路內的集中式子網路管理員(subnet manager)加以管理。
Operations & tooling標準的 Ethernet 維運:BGP、EVPN、gNMI/OpenConfig 遙測,以及在整個資料中心通用的相同自動化工具(Ansible、NETCONF)。專門的 InfiniBand 工具與子網路管理員,與資料中心其餘部分的維運模式各自獨立。
廠商鎖定本質上不存在:可自由混搭硬體與軟體,並為供應鏈建立第二來源。高:NIC、交換器、纜線與管理通常都來自單一廠商。
Cost trend以 400G 與 800G 執行 OcNOS-DC 的開放硬體主幹,其成本明顯低於單一廠商網路,而且隨著連接埠速率提升,差距會進一步擴大。在同等容量下,單一廠商的定價會帶有溢價。

InfiniBand 是 InfiniBand Trade Association 的商標。NVIDIA 與 Mellanox 是其各自擁有者的商標。本比較僅供資訊參考之用,並不暗示任何關聯或背書。

決策

各自的制勝場景

正確的答案取決於工作負載。若需求是絕對的延遲下限,請選擇 InfiniBand;若決策取決於維運模式、成本或跨站點的傳輸距離,則請選擇 RoCE。

InfiniBand 適合的情況

延遲下限就是規格要求

在緊密耦合的 HPC 模擬中,絕對的 NIC 對 NIC 延遲下限比總體擁有成本更為重要;以及在可接受單一廠商堆疊的專屬單租戶叢集中。

RoCE 適合的情況

維運與供應鏈至關重要

多租戶的 GPU 即服務(GPU-as-a-Service)以及 AI 後端,與資料中心其餘部分共用同一套維運模式、同一套工具堆疊,以及多廠商的供應鏈。

RoCE 適合的情況

每個 GPU 的成本是關鍵門檻

開放硬體主幹搭配 OcNOS-DC,可消除單一廠商網路的溢價。在數千個 GPU 的建置中,這在硬體預算中占有相當可觀的比例。

RoCE 適合的情況

網狀架構橫跨多個資料中心

Ethernet 可透過 400G ZR/ZR+ 相干光學模組,自然地跨越機房與區域延伸,而無需另設長途閘道層。

開放之路

OcNOS-DC 如何實現 RoCEv2 路徑

OcNOS-DC 提供 RoCEv2 所需的無損 Ethernet 基礎。交換器負責提供避免遺失與壅塞控制的基本機制;RoCEv2 則是運行於 NIC 上的傳輸方式。這些皆為 OcNOS-DC 今日已驗證的交換器功能。

Losslessness

PFC and ECN

優先權流量控制(Priority Flow Control),包括在 Layer 3 上搭配 DCBX/LLDP 的 PFC-with-QoS,以及 ECN 與 Dynamic ECN,讓 RDMA 流量維持較淺的佇列而不丟棄封包。

Congestion

DCQCN 標記

交換器會標記 ECN,讓端到端的 NIC 加交換器的 DCQCN 迴路 得以限制傳送端的速率。ETS 與 WRED 則負責整形並管理承載 RDMA 的佇列。

負載平衡

DLB 與 RTAG7

動態負載均衡 (包含 Reactive Path Rebalance 與 Random Flow)搭配 RTAG7 雜湊,可分散集體通訊流量並在本地壅塞時重新平衡。

Resilience

PFC 死鎖保護

PFC 死結偵測與復原(Deadlock Detection and Recovery) 再加上緩衝區調校,可在 PFC 可能造成的暫停擴散下,維持無損網路的穩定。

遙測

gNMI / OpenConfig

Streaming gNMI 與 OpenConfig 遙測 可提供逐優先權的可見性,用於叢集建置期間與穩態運作時的閉迴路調校。

UEC-ready

與 UEC 1.0 對齊

IP Infusion 是 Ultra Ethernet Consortium 的貢獻成員,且 OcNOS-DC 與 UEC 1.0 網路配置檔案對齊,因此在具備 UEC 能力的 NIC 上市後,網路可延續沿用。對齊並不等同於認證聲明。

晶片選擇是開放的:OcNOS-DC 可在採用 Broadcom Tomahawk 5 的 Edgecore AIS800-64D 與 UfiSpace S9321-64E / S9321-64EO(-64EO 額外提供 400G ZR+)上執行,也可在採用 Tomahawk 4 的 Edgecore AS9736-64D 上執行,這些皆為針對 RoCEv2 調校的晶片內建與共用緩衝區平台。單一份 IP Infusion 合約即涵蓋軟體與驗證過的硬體,並提供單一 TAC 與單一 SLA。

為何轉變

為何眾多業者將 AI 後端轉向 Ethernet

這項轉變在維運與經濟層面上的意義,遠大於單純的延遲。在大型建置中,有三項因素會迅速累積效益:與資料中心其餘部分共用的單一網路模式、多廠商的供應鏈,以及 400G 與 800G 下更低的每連接埠成本。

這樣的規模已在實務現場獲得驗證。Meta 曾描述在一個 24,000-GPU 叢集上,透過 RoCE Ethernet 網路訓練其最大型的模型,而這樣的規模過去一度被認為必須採用 InfiniBand。Tomahawk 4 與 Tomahawk 5 上的自適應負載平衡會依即時壅塞重新分配流量,因此在靜態雜湊會使流量受困之處,運作良好的網路可將使用率目標設定在 90% 以上。90% 是設計目標,而非實測保證。

InfiniBand 仍存的優勢,也就是更低的絕對延遲下限,對於一組緊密耦合的 HPC 工作負載而言仍然重要。但對於大規模下多數的分散式訓練與推論集體通訊而言,正確調校的 RoCEv2 網路已低於會改變作業完成時間的門檻,這正是為何維運與經濟上的考量如今決定了多數新的 AI 後端建置。

  • 與資料中心其餘部分共用的單一網路模式,讓技能與工具得以延續沿用。
  • 多廠商的供應鏈,讓您能為晶片、交換器、NIC 與光學模組建立第二來源。
  • 400G 與 800G 下更低的每連接埠成本,釋出資金以投入更多 GPU、更大的儲存層,或第二座站點。
簡短版本

兩者皆為有效選擇,而多數新的 AI 後端最終選擇 Ethernet

InfiniBand 保有更低的絕對延遲下限,而一組緊密耦合的 HPC 工作負載將持續為此付出代價。但對多數 AI 後端建置而言,維運與經濟上的考量會傾向於選擇在開放 Ethernet 上運行的 RoCEv2。

兩者皆為有效選擇

InfiniBand 保有更低的絕對延遲下限,而一組緊密耦合的 HPC 工作負載將持續為此付出代價。

RoCEv2 已為 AI 縮小了差距

只要正確設定 PFC、ECN、DCQCN 與自適應負載平衡,Ethernet 在多數分散式訓練集體通訊上即可與 InfiniBand 匹敵,同時保有硬體選擇的彈性。

決策通常取決於維運

單一網路模式、多廠商的供應鏈,以及 400G 與 800G 下更低的每連接埠成本,決定了多數新的 AI 後端建置。

OcNOS-DC 是開放之路

今日提供已驗證的 RoCEv2 基本機制,明日與 UEC 1.0 對齊,運行於來自 Edgecore 與 UfiSpace 的驗證過開放硬體之上,並涵蓋於單一合約、單一 TAC 與單一 SLA 之下。

資源

取得 AI Fabric 參考設計

The full PDF: lossless RoCEv2 topology, switch and transceiver counts, validated platforms, and a DCQCN starting profile on OcNOS-DC.

下載 PDF
常見問題

RoCE 與 InfiniBand 常見問題

RoCE 與 InfiniBand 有何差異?
RoCE(實務上即 RoCEv2)透過標準且可路由的 Ethernet 與 IP 承載 RDMA,因此可重複運用任何廠商都能提供的交換器、NIC、光學模組與維運工具。InfiniBand 則是獨立的專用網路,具備來自單一廠商的專屬交換器、介面卡、纜線與子網路管理員。RoCEv2 透過 PFC 與 ECN 維持網路無損,並以 DCQCN 控制壅塞,而 InfiniBand 則仰賴在設計上即為無損的信用式流量控制。
在 AI 應用上,Ethernet 與 InfiniBand 一樣快嗎?
對於大規模下多數的分散式訓練集體通訊而言,是的。InfiniBand 在絕對延遲下限上仍低數百奈秒,但一旦 RoCEv2 設定了 PFC、ECN、DCQCN 與自適應負載平衡,該差距對多數 AI 工作負載而言,便低於會改變作業完成時間的程度。基於此原因,如今許多業者已在 Ethernet 上運行大型 AI 後端網路。
什麼是 RoCEv2?
RoCEv2(RDMA over Converged Ethernet 第 2 版)將 RDMA 封裝於目的地連接埠 4791 的 UDP/IP 之中,因此 RDMA 流量可在 Layer 3 Ethernet 網路上進行路由。它讓 GPU 與儲存裝置能以低延遲、低 CPU 負擔的方式在記憶體之間直接搬移資料,這正是它成為在開放的多廠商 Ethernet 網路上運行 RDMA 主流方式的原因。
RoCE 需要無損網路嗎?
是的。當封包遭到丟棄時,RoCEv2 的效能會急遽下降,因此它需要無損或近乎無損的網路。業者會以 PFC 進行逐跳流量控制,並以 ECN 搭配 DCQCN 進行端到端壅塞控制來達成此目的,讓交換器佇列維持較淺,使 RDMA 流量避免丟棄與重傳。交換器提供無損的基礎;RoCEv2 則是運行於 NIC 上的傳輸方式。
我可以在開放交換器上運行 RoCE 嗎?
可以。RoCEv2 運行於標準的 Ethernet 晶片上。OcNOS-DC 在驗證過的開放硬體(例如以 Broadcom Tomahawk 4 與 Tomahawk 5 為基礎的 Edgecore 與 UfiSpace 平台)上提供 RoCEv2 的建構元件(PFC、在 Layer 3 上的 PFC-with-QoS、ECN、Dynamic ECN、ETS、WRED、DLB、PFC 死結偵測與復原,以及 gNMI/OpenConfig 遙測)。單一份 IP Infusion 合約即涵蓋軟體與驗證過的硬體。
那 Ultra Ethernet 又如何?
Ultra Ethernet(UEC)是一項開放標準,為 Ethernet 帶來封包噴灑、多路徑 RDMA、亂序傳遞與現代化的壅塞控制,縮小了 InfiniBand 過去獨有的優勢。IP Infusion 是 Ultra Ethernet Consortium 的貢獻成員,且 OcNOS-DC 在今日即與 UEC 1.0 網路設定檔(fabric profile)對齊,完整的 UEC 傳輸則會在具備 UEC 能力的 NIC 上市後啟用。與此設定檔對齊並不等同於認證聲明。

正在評估 RoCEv2 網路與 InfiniBand 的規模比較嗎?讓我們一起進行針對工作負載的精算

只要告訴我們工作負載與 GPU 規模,IP Infusion 的工程師就會與您一同進行數字試算,或者您也可以先在 AI Fabric Design Suite 中建立初步的葉主幹配置。