RoCEv2 · DLB · Ultra Ethernet

適用於 AI Fabric 的 InfiniBand 與 Ethernet 對比

對大多數 AI 網狀架構而言,選乙太網路;對延遲要求嚴苛的 HPC,選 InfiniBand。 採用 RoCEv2 的現代乙太網路,如今已能在開放、多供應商硬體上以 400G 與 800G 運行正式環境的網狀架構,而 OcNOS-DC 現在即可交付。本指南說明兩者各自仍適用的場景。

三分之二乙太網路占比,AI 向外擴展
最高 800G正式環境 RoCEv2 網狀架構
1 NOS開放硬體上的 OcNOS-DC
600+OcNOS 上的電信業者網路
兩種網狀架構,兩套營運模式

相同的 GPU,兩張截然不同的網路

左側是單一廠商的 InfiniBand fabric:一家晶片廠商、一條交換器產品線、一套 NIC 生態,以及一個獨立於資料中心其餘部分的子網管理器。右側是多廠商的開放乙太網路 fabric:來自任意廠商的 RoCEv2 NIC、Broadcom 交換晶片、作為 NOS 的 OcNOS-DC,以及您已在執行的同一套協定。

InfiniBand 單廠商 fabric 對比多廠商乙太網 fabric 並排展示的兩種網路拓撲。左側:由兩台 IB 交換器和三個 GPU 組成的單一廠商 InfiniBand 網路。右側:由兩台 OcNOS-DC spine 交換器和三個配備 RoCEv2 NIC 的 GPU 組成的多廠商乙太網路網路。底部標註對比單一廠商技術堆疊和開放的多廠商技術堆疊。 INFINIBAND · 單一廠商 ETHERNET · 開放多廠商 IB 交換機 1Quantum 級 IB 交換機 2Quantum 級 GPUIB NIC GPUIB NIC GPUIB NIC NIC 與交換機來自同一廠商 子網管理器 · 多租戶能力有限 Spine-1OcNOS-DC · TH5 Spine-2OcNOS-DC · TH5 GPURoCEv2 GPURoCEv2 GPURoCEv2 多廠商 · 開放硬體 RoCEv2 · DLB · GLB · EVPN-VXLAN · gNMI 單一廠商技術棧與開放多廠商技術棧
兩者比較

InfiniBand 與乙太網路,逐項比較

InfiniBand 是為低延遲、無損 RDMA 而量身打造,這在二十年間讓它在緊密耦合的 HPC 上擁有真正的優勢。而建構於 DCB 堆疊、RoCEv2,以及日益成熟的 DLB 與 UEC 之上的現代乙太網路,在過去數年間持續縮小這道差距。哪些差距仍然重要,取決於工作負載。

維度 InfiniBand單一廠商 EthernetRoCEv2 / UEC,開放
時延下限端到端 NIC 到 NIC 時延極低;交換機單跳通常為數百納秒。時延下限比 IB 高出數百納秒,但仍遠低於會影響大規模分布式訓練集合通信的閾值。
丟包容忍度架構層面無損(基於信用的流量控制)。通過 PFC + ECN + DCQCN 實現無損。如今已達生產級;UEC 進一步降低對 PFC 暫停的依賴。
多路徑 / 負載均衡自適應路由已內置於規範中。靜態 ECMP,外加用於自適應單跳的 DLB、用於端到端的 GLB(OcNOS 7.1),以及適用於下一代的 UEC 報文噴灑。
廠商生態系統在 NIC 和交換機晶片方面實際上均為單一供應商。每一層均支持多廠商:ASIC、交換機、NIC、NOS、光模組。UEC 明確為廠商中立的互操作而設計。
營運模式子網管理器(UFM 級別)。與 DC 其餘部分不同。需要單獨的技能與單獨的工具鏈。沿用您已在運行的 BGP、EVPN、gNMI。與資料中心其餘部分採用相同的自動化工具(Ansible、NETCONF、OpenConfig)。
多租戶有限;存在分區機制,但並非一流概念。通過 EVPN-VXLAN 原生支持。GPU-as-a-Service、多團隊叢集、共享基礎設施皆水到渠成。
長距離 DCI並非為此設計;需要 IB-over-WAN 網關。通過 400G ZR/ZR+ 相干可插拔模組和 EVPN 跨資料中心原生實現。
儲存融合儲存與計算並行運行;需要 IB 連接的儲存。NVMe-oF、NFS、S3 全部運行在同一套乙太網網路上。
路線圖推進速度受制於單一廠商的版本發布節奏。成員涵蓋晶片、NIC、交換器和雲端運算企業的 UEC 聯盟推動著公開發布的規範演進。
決策

各自的制勝場景

正確答案因工作負載而異。當需求是絕對的延遲下限時,選 InfiniBand;當營運模式、成本或跨站點的觸及範圍是決策關鍵時,選乙太網路。

何時選擇 InfiniBand

延遲下限具有合約性

在絕對延遲下限比整體擁有成本更重要的 HPC 模擬,以及可接受鎖定、緊密且封閉的單一租戶叢集。

在以下情況選擇乙太網

營運模式至關重要

多租戶的 GPU 即服務,以及與資料中心其餘部分共享基礎架構的叢集,在此單一營運模式、單一工具堆疊與多供應商供應鏈勝出。

在以下情況選擇乙太網

每 GPU-flop 的成本是關鍵門檻

OcNOS-DC 執行於多家供應商的開放硬體上,因此交換硬體可透過競爭方式採購。

在以下情況選擇乙太網

網狀架構橫跨多個資料中心

如果一次訓練作業有朝一日要跨越兩座機房或兩個區域,相干 DCI、EVPN 跨資料中心互連,以及標準的多供應商光模組,能讓它成為一天就能解決的問題,而非耗時一季的線路系統專案。

差距在何處消弭

現代乙太網路增添了什麼

三項進展將正式環境的 AI 網狀架構推上乙太網路:真正無損的行為、讓流量避開壅塞上行鏈路的自適應路由,以及對封包散播友善的次世代傳輸。

無損行為

RoCEv2 搭配 PFC、DCQCN,以及 PFC 死結監控程式 在標準乙太網路上提供 AI 集合通訊所需的無損 RDMA 傳輸,如今已達正式環境等級。

自適應路由

AI 工作負載上的靜態 ECMP 衝突確實存在,但 DLB 在毫秒以下的時間窗內,針對局部壅塞重新分配 flowlet,而 OcNOS 7.1 中的 GLB 更將其延伸至端到端的路徑評分。

對封包散播友善的傳輸

Ultra Ethernet(UEC 1.0,2025 年 6 月)帶來 封包散播、多路徑 RDMA 與亂序遞送 。現在即可基於 RoCEv2 建構,並隨著支援 UEC 的 NIC 上市規劃 UEC。

TCO 探討

網路只是一小筆支出,因此比較時應著眼於它所釋放出的資源

在五年期間,交換層僅占叢集 TCO 的個位數百分比,若計入 NIC、光模組與佈線則會上升。有意義的問題不在於這筆支出本身,而在於省下的資本能投入什麼。

  • OcNOS-DC 執行於多家供應商的開放硬體上,因此交換硬體可透過競爭方式採購。
  • 省下的資本可投入更多 GPU、更大的儲存層,或用於強化韌性的第二個站點。
  • 在網狀架構屬多租戶或與資料中心其餘部分共享的場景,單一網路模式的價值高於這筆支出的差額。
IP Infusion 的觀點

兩者各有其定位,而大多數 AI 網狀架構屬於乙太網路

乙太網路並非在每種工作負載上都勝出,但在多數情況下,其營運與經濟上的理由具決定性,且隨著技術差距的消弭而更加穩固。

兩者各有其定位

乙太網路並非在每種工作負載上都勝出。對延遲有絕對下限要求的緊密 HPC 叢集,仍偏好 InfiniBand。

大多數 AI 網狀架構屬於乙太網路

隨著營運與經濟理由日益增強、技術差距持續縮小,超大規模的正式環境 AI 訓練與推論正轉向乙太網路。

OcNOS-DC 是開放之路

目前支援 RoCEv2 與 DLB,OcNOS 7.1 提供 GLB。一套 NOS、一套功能集,執行於來自 Edgecore、UfiSpace 等廠商經過驗證的開放硬體之上。

InfiniBand 與乙太網路,為您解答

與 InfiniBand 相比,Ethernet 對於 AI 訓練是否足夠快?
對於大規模的多數分散式訓練集合通訊而言,是的。Ethernet的延遲下限比InfiniBand高出數百奈秒,但只要正確設定了具備PFC、DCQCN與DLB的RoCEv2,此一差異便低於影響多數工作負載的門檻。
在哪些情況下仍應選擇 InfiniBand?
對於絕對延遲下限比total cost of ownership更重要的緊耦合HPC模擬,以及可接受single-vendor lock-in的封閉式單租戶叢集,請選擇InfiniBand。
在 AI fabric 中,Ethernet 何時更具優勢?
在多租戶 GPU-as-a-Service、與 data center 其餘部分共用同一維運模型和工具的叢集、對成本敏感的數千 GPU 規模建置,以及透過 coherent DCI 和 EVPN 跨 data center 延伸的 fabric 等場景中,Ethernet 更勝一籌。
OcNOS 如何縮小與 InfiniBand 的差距?
OcNOS-DC 目前提供 RoCEv2 無損傳輸、DLB 自適應路由以及 PFC 死結看門狗,並在 7.1 中提供用於端到端路徑評分的 GLB,全部執行於 Edgecore、UfiSpace 等廠商的經過驗證的開放硬體之上。
超大規模業者是否正以乙太網路取代 InfiniBand 來部署 AI?
大體如此,不過 InfiniBand 並不會消失。據 Dell'Oro Group 資料,在 AI 後端(橫向擴展)交換領域,乙太網路已超越 InfiniBand,到 2026 年初約佔市場三分之二,而 2023 年底 InfiniBand 曾佔據約 80% 的份額。Dell'Oro 還指出,隨著 NVIDIA Blackwell Ultra 800G 放量,InfiniBand 出現強勁反彈,因此它仍是緊耦合 HPC 的專用之選。Meta 曾表示,其最大的模型是在兩個 24,576-GPU 叢集之一上,透過 RoCE 乙太網路 fabric 完成訓練的。成員涵蓋晶片、NIC、交換器和雲端運算企業的 Ultra Ethernet Consortium 正在標準化這一方向。原因在於營運與經濟:與資料中心其餘部分共享的統一網路模型、多廠商供應鏈,以及在 400G 和 800G 下更低的每埠成本。
在 AI 叢集網路方面,InfiniBand 最佳的替代方案是什麼?
採用 RoCEv2 的乙太網路是主流替代方案。它藉助 PFC、ECN 和 DCQCN 無損地承載 RDMA,並透過 DLB 加入自適應路由,OcNOS-DC 在開放的多廠商硬體而非單一廠商 fabric 上交付這一切。Ultra Ethernet(UEC)在支援 UEC 的 NIC 上增加封包噴灑和多路徑 RDMA。
Ultra Ethernet 與 InfiniBand 有何差異?
Ultra Ethernet(UEC)為標準乙太網路加入一種專為 AI 與 HPC 設計的傳輸:跨所有路徑的封包散播、多路徑 RDMA、亂序遞送,以及選擇性重傳。於 2025 年 6 月發布的 UEC 1.0 規格定義了這項傳輸。差異在於生態系:InfiniBand 在 NIC 與交換晶片方面實質上是單一供應商,而 Ultra Ethernet 是任何供應商都能據以建構的開放、多供應商規格。
相較於 InfiniBand,乙太網路 AI 網狀架構的成本是多少?
交換層在 AI 叢集的整體擁有成本中占比不高,五年期間通常為個位數百分比,不過若計入 NIC、光模組與佈線,這個數字會上升。OcNOS-DC 執行於多家供應商的開放硬體上,因此交換硬體可透過競爭方式採購。更有意義的問題是省下的資本能投入什麼,無論是更多 GPU、更大的儲存層,或用於強化韌性的第二個站點。如需了解您所用平台的價格,請聯絡 IP Infusion。

正在為下一座叢集估算規模嗎?取得針對特定工作負載的評估

告訴我們工作負載與 GPU 規模,IP Infusion 的工程師將與您一同進行計算,或者您也可以先在 AI Fabric Design Suite 中初步規劃葉脊式配置。