RoCEv2:適用於 AI fabric 的無損乙太網
RoCEv2 是 RDMA 在標準 Ethernet 上運作的方式:它將 RDMA 封裝於 UDP/IP 之中,並使用 UDP 目的地連接埠 4791,因此 GPU 集體通訊流量可在一般的葉主幹網路上進行路由。 它需要由 PFC 與 ECN 建構的無損網路,並以 DCQCN 作為壅塞控制迴路,而 OcNOS 在今日即可於受支援的 400G 與 800G 開放硬體上提供完整的工具組。
相同的 GPU 在無損葉主幹網路上
一個精簡的軌道切片:兩個主幹與兩個葉節點在四個 GPU 之間承載 RoCEv2。PFC 暫停訊框會在壅塞時逐跳傳遞,而 ECN 則會標記大流量(elephant flow),以供來源端的 DCQCN 反應。RDMA 封裝於目的地連接埠 4791 的 UDP/IP 之中,因此相同的流量可在標準 Ethernet 網路上進行路由。

近乎零遺失讓 GPU 集體通訊維持高效率
GPU 集體通訊(all-reduce、all-gather、all-to-all)會產生大流量,使單一網路路徑飽和,並需要近乎零的遺失才能維持訓練作業的效率。在 400G RoCEv2 鏈路上只要遺失一個封包,受影響的 NIC 就會重傳整個 RDMA 傳送視窗,這會造成長達數秒可測得的 GPU 閒置時間。RoCEv2 透過將 RDMA 封裝於目的地連接埠 4791 的 UDP/IP 之中,將葉主幹網路轉變為這些工作負載的無損傳輸,因此相同的流量可在 Layer 3 上進行路由。
| Parameter | RoCEv1二層 | RoCEv2UDP/IP,可路由 |
|---|---|---|
| Encapsulation | RDMA 直接透過 Ethernet 傳輸(採用專屬的 EtherType)。 | RDMA 封裝於 UDP/IP 之中,使用 UDP 目的地連接埠 4791。 |
| 網路層 | 僅限 Layer 2;侷限於單一廣播網域。 | 可在標準葉主幹網路上進行 Layer 3 路由。 |
| ECMP 熵值 | 沒有可供雜湊的 IP 或 UDP 標頭;路徑分散有限。 | 以 UDP 來源連接埠作為流量識別碼加以變化,將流量分散至各條 ECMP 路徑。 |
| 無損需求 | 需要由 PFC 與 ECN 建構的無損網路。 | 需要由 PFC 與 ECN 建構的無損網路,並以 DCQCN 作為壅塞控制迴路。 |
| 傳輸距離與規模 | 限於單一機架或單一子網路內。 | 已路由的資料中心網路;提供 256 至 4,096 個 GPU 叢集的參考設計。 |
使網路維持無損的控制機制
RoCEv2 網路透過三種相互協作的機制維持無損:優先權流量控制會暫停正確的流量類別,ECN 與 DCQCN 在不產生遺失的情況下維持吞吐量,而自適應路由則讓少數幾條大流量避開壅塞的上行鏈路。
按優先級暫停
802.1Qbb PFC 會逐跳暫停單一流量類別,使承載 RDMA 的佇列永不丟棄封包。OcNOS 並將其搭配 PFC 死鎖看門狗 此機制可偵測停滯的優先權,並在其擴散之前自動復原。
ECN 標記與 DCQCN 迴路
以 WRED 為基礎的 ECN 會在佇列累積時標記封包,而 DCQCN 則是壅塞控制迴路 此迴路會在來源端反應,以在不產生遺失的情況下維持吞吐量。針對 xCCL 集體通訊提供已調校的預設值,並可為自訂 RDMA 堆疊進行參數覆寫。
自適應流片(flowlet)路由
靜態 ECMP 雜湊會在 AI 集體通訊所產生的少數幾條大流量上發生碰撞。 DLB 會在本地鏈路飽和時,於次毫秒的時間視窗內重新分配流片,消除會損害對稱拓撲的靜態雜湊碰撞。
OcNOS 所提供的 RoCEv2
除了無損控制機制之外,OcNOS 還提供遙測、參考設計以及清晰的升級路徑,將無損組態轉變為可實際運作的網路。
按優先級隊列統計
提供 gNMI 串流感測器,用於監測佇列深度、PFC 暫停計數器、經 ECN 標記的封包以及微突發偵測,並以 10 秒取樣間隔 匯出,以達成全網路的可觀測性。
軌道最佳化(rail-optimized)網路
提供軌道對齊與排程式網路拓撲的參考設計,涵蓋 256 至 4,096 個 GPU 叢集 於現成的 400G 與 800G 開放交換器上運行。CLI 診斷可端到端驗證已知良好的無損組態。
邁向 Ultra Ethernet 的清晰路徑
在今日建構無損的 RoCEv2,同時保留通往 Ultra Ethernet的開放路徑,其在 UEC NIC 上市時,為標準 Ethernet 加入封包噴灑與多路徑 RDMA。單一 NOS 即可同時承載兩者。
橫跨開放硬體的單一 NOS 映像檔
RoCEv2 工具組是 OcNOS-DC 基本授權的一部分,而非一組付費附加元件,且可在多廠商的硬體選擇之間原封不動地執行。
- 開放的硬體選擇。 以相同的 NOS 映像檔在 UfiSpace、Edgecore 或 Celestica 平台上執行 RoCEv2,讓網路層不帶有任何廠商鎖定。
- 第一天即具備同等功能。 自適應負載平衡、DCQCN 調校以及 ASIC 原生遙測,皆屬於 OcNOS-DC 基本授權的一部分,而非付費附加元件。
- 參考設計。 提供熱門 AI 網路拓撲的參考組態,並公開這些組態與測試結果。
- 工程訪問權限。 高階支援方案包含在網路建置期間與 OcNOS RoCEv2 團隊直接對話。
標準 Ethernet、RDMA 效能、開放硬體
RoCEv2 讓 AI 網路能夠重複運用資料中心其餘部分既有的 Ethernet 維運方式與設備,而 OcNOS 正是讓它在開放交換器上實現無損的推手。
標準 Ethernet,RDMA 速度
RoCEv2 透過可路由的 UDP/IP 承載 RDMA,讓 GPU 集體通訊無需另建專用網路,即可獲得低延遲、低 CPU 負擔的資料傳輸。
開放硬體選擇
相同的無損組態可在 UfiSpace、Edgecore 與 Celestica 的 400G 與 800G 交換器上執行,讓網路層維持多廠商。
OcNOS 是推手
PFC、ECN、DCQCN、DLB 以及逐優先權遙測以單一 NOS 的形式在開放交換器上提供,因此完整的無損網路是一項建置工作,而非整合專案。
RoCEv2,為您解答
什麼是 RoCEv2?
RoCEv2與RoCEv1有何區別?
RoCEv2 是否需要 lossless 網路?
RoCEv2使用哪個UDP連接埠?
RoCEv2 與 InfiniBand 相比如何?
深入了解,隨身帶走。
產品規格書,以及內容比本頁更為深入的簡明技術下載資料。
OcNOS 800G 無損 AI Fabric
表單簡短。提交後您的 PDF 將立即在新標籤頁中打開。
✓ 正在新標籤頁中打開您的 PDF……
如果未能自動打開,請使用下方連結。
EVPN-VXLAN 資料中心網路
表單簡短。提交後您的 PDF 將立即在新標籤頁中打開。
✓ 正在新標籤頁中打開您的 PDF……
如果未能自動打開,請使用下方連結。
正在建置或擴充 AI 網路嗎?取得針對工作負載的專屬評估
只要告訴我們 GPU 規模與集體通訊模式,IP Infusion 的工程師就會與您一同規劃各交換器層的規模並調校無損組態,或者您也可以先在 AI Fabric Design Suite 中建立初步的葉主幹配置。
以 OcNOS 設計整套 AI 網狀架構
從商業論證到埠數計算,無論您的建置進行到哪個階段,都能從此接續。