RoCEv2 · DLB · Ultra Ethernet

適用於 AI Fabric 的 InfiniBand 與 Ethernet 對比

對大多數 AI 網狀架構而言,選乙太網路;對延遲要求嚴苛的 HPC,選 InfiniBand。 採用 RoCEv2 的現代乙太網路,如今已能在開放、多供應商硬體上以 400G 與 800G 運行正式環境的網狀架構,而 OcNOS-DC 現在即可交付。本指南說明兩者各自仍適用的場景。

Two-thirds乙太網路占比,AI 向外擴展
最高 800G正式環境 RoCEv2 網狀架構
1 NOS開放硬體上的 OcNOS-DC
600+OcNOS 上的電信業者網路
兩種網狀架構,兩套營運模式

相同的 GPU,兩張截然不同的網路

左側是單一供應商的 InfiniBand 網狀架構:單一晶片供應商、單一交換器產品線、單一 NIC 生態系,以及一個與資料中心其餘部分相互獨立的子網路管理員。右側是多供應商的開放乙太網路網狀架構:來自任何供應商的 RoCEv2 或 UEC NIC、Broadcom 交換晶片、作為 NOS 的 OcNOS-DC,以及您早已在運行的相同協定。

InfiniBand 單廠商 fabric 對比多廠商乙太網 fabric Two side-by-side fabric topologies. Left: a single-vendor InfiniBand fabric with two IB switches and three GPUs. Right: a multi-vendor Ethernet fabric with two OcNOS-DC spines and three GPUs with RoCEv2 or UEC NICs. Bottom labels contrast a single-vendor stack with an open multi-vendor stack. INFINIBAND · SINGLE-VENDOR ETHERNET · OPEN MULTI-VENDOR IB 交換機 1Quantum-class IB 交換機 2Quantum-class GPUIB NIC GPUIB NIC GPUIB NIC SINGLE NIC + SWITCH VENDOR SUBNET MANAGER · LIMITED MULTI-TENANCY Spine-1OcNOS-DC · TH5 Spine-2OcNOS-DC · TH5 GPURoCEv2/UEC GPURoCEv2/UEC GPURoCEv2/UEC MULTI-VENDOR · OPEN HARDWARE RoCEv2 · DLB · GLB · UEC · EVPN-VXLAN · gNMI SINGLE-VENDOR STACK vs OPEN MULTI-VENDOR STACK
兩者比較

InfiniBand 與乙太網路,逐項比較

InfiniBand 是為低延遲、無損 RDMA 而量身打造,這在二十年間讓它在緊密耦合的 HPC 上擁有真正的優勢。而建構於 DCB 堆疊、RoCEv2,以及日益成熟的 DLB 與 UEC 之上的現代乙太網路,在過去數年間持續縮小這道差距。哪些差距仍然重要,取決於工作負載。

Axis InfiniBandsingle-vendor EthernetRoCEv2 / UEC,開放
時延下限端到端 NIC 到 NIC 時延極低;交換機單跳通常為數百納秒。時延下限比 IB 高出數百納秒,但仍遠低於會影響大規模分布式訓練集合通信的閾值。
丟包容忍度架構層面無損(基於信用的流量控制)。通過 PFC + ECN + DCQCN 實現無損。如今已達生產級;UEC 進一步降低對 PFC 暫停的依賴。
多路徑 / 負載均衡自適應路由已內置於規範中。靜態 ECMP,外加用於自適應單跳的 DLB、用於端到端的 GLB(OcNOS 7.1),以及適用於下一代的 UEC 報文噴灑。
廠商生態系統在 NIC 和交換機晶片方面實際上均為單一供應商。每一層均支持多廠商:ASIC、交換機、NIC、NOS、光模組。UEC 明確為廠商中立的互操作而設計。
營運模式子網管理器(UFM 級別)。與 DC 其餘部分不同。需要單獨的技能與單獨的工具鏈。沿用您已在運行的 BGP、EVPN、gNMI。與資料中心其餘部分採用相同的自動化工具(Ansible、NETCONF、OpenConfig)。
Multi-tenancy有限;存在分區機制,但並非一流概念。通過 EVPN-VXLAN 原生支持。GPU-as-a-Service、多團隊叢集、共享基礎設施皆水到渠成。
長距離 DCI並非為此設計;需要 IB-over-WAN 網關。通過 400G ZR/ZR+ 相干可插拔模組和 EVPN 跨資料中心原生實現。
儲存融合儲存與計算並行運行;需要 IB 連接的儲存。NVMe-oF、NFS、S3 全部運行在同一套乙太網網路上。
每埠成本(典型 400G+)高端;單一廠商定價。開放硬體 spine + OcNOS-DC NOS,相比廠商鎖定方案具有實質性成本優勢。
路線圖推進速度受制於單一廠商的版本發布節奏。UEC 聯盟(AMD、Arista、Broadcom、Cisco、HPE、Intel、Meta、Microsoft、Oracle)推動公開發布的規格演進。
決策

各自的制勝場景

正確答案因工作負載而異。當需求是絕對的延遲下限時,選 InfiniBand;當營運模式、成本或跨站點的觸及範圍是決策關鍵時,選乙太網路。

何時選擇 InfiniBand

延遲下限具有合約性

在絕對延遲下限比整體擁有成本更重要的 HPC 模擬,以及可接受鎖定、緊密且封閉的單一租戶叢集。

在以下情況選擇乙太網

營運模式至關重要

多租戶的 GPU 即服務,以及與資料中心其餘部分共享基礎架構的叢集,在此單一營運模式、單一工具堆疊與多供應商供應鏈勝出。

在以下情況選擇乙太網

每 GPU-flop 的成本是關鍵門檻

搭配 OcNOS-DC 的開放硬體骨幹交換器,去除了單一供應商網路的溢價。在數千顆 GPU 的叢集上,這在硬體預算中占有相當比重。

在以下情況選擇乙太網

網狀架構橫跨多個資料中心

如果一次訓練作業有朝一日要跨越兩座機房或兩個區域,相干 DCI、EVPN 跨資料中心互連,以及標準的多供應商光模組,能讓它成為一天就能解決的問題,而非耗時一季的線路系統專案。

差距在何處消弭

現代乙太網路增添了什麼

三項進展將正式環境的 AI 網狀架構推上乙太網路:真正無損的行為、讓流量避開壅塞上行鏈路的自適應路由,以及對封包散播友善的次世代傳輸。

無損行為

RoCEv2 with PFC、DCQCN,以及 PFC 死結監控程式 在標準乙太網路上提供 AI 集合通訊所需的無損 RDMA 傳輸,如今已達正式環境等級。

自適應路由

AI 工作負載上的靜態 ECMP 衝突確實存在,但 DLB 在毫秒以下的時間窗內,針對局部壅塞重新分配 flowlet,而 OcNOS 7.1 中的 GLB 更將其延伸至端到端的路徑評分。

對封包散播友善的傳輸

Ultra Ethernet(UEC 1.0,2025 年 6 月)帶來 封包散播、多路徑 RDMA 與亂序遞送 至標準乙太網路。現在就以 RoCEv2 為基礎建構,並在 NIC 出貨時保留一條通往 UEC 的清晰路徑。

TCO 探討

網路只是一小筆支出,因此比較時應著眼於它所釋放出的資源

在五年期間,交換層僅占叢集 TCO 的個位數百分比,若計入 NIC、光模組與佈線則會上升。有意義的問題不在於這筆支出本身,而在於省下的資本能投入什麼。

  • 在同等容量下,單一供應商的 InfiniBand 相較於開放硬體的乙太網路帶有價格溢價。
  • 省下的資本可投入更多 GPU、更大的儲存層,或用於強化韌性的第二個站點。
  • 在網狀架構屬多租戶或與資料中心其餘部分共享的場景,單一網路模式的價值高於這筆支出的差額。
IP Infusion 的觀點

兩者各有其定位,而大多數 AI 網狀架構屬於乙太網路

乙太網路並非在每種工作負載上都勝出,但在多數情況下,其營運與經濟上的理由具決定性,且隨著技術差距的消弭而更加穩固。

兩者各有其定位

乙太網路並非在每種工作負載上都勝出。對延遲有絕對下限要求的緊密 HPC 叢集,仍偏好 InfiniBand。

大多數 AI 網狀架構屬於乙太網路

隨著營運與經濟理由日益增強、技術差距持續縮小,超大規模的正式環境 AI 訓練與推論正轉向乙太網路。

OcNOS-DC 是開放之路

當前支持 RoCEv2,當前支持 DLB,下一步支持 GLB,並將隨網卡上市支持 UEC。一套 NOS、一份特性路線圖,運行於來自 Edgecore、UfiSpace 等廠商的經過驗證的開放硬體之上。

常見問題

InfiniBand 與乙太網路,為您解答

與 InfiniBand 相比,Ethernet 對於 AI 訓練是否足夠快?
對於大規模的多數分散式訓練集合通訊而言,是的。Ethernet的延遲下限比InfiniBand高出數百奈秒,但只要正確設定了具備PFC、DCQCN與DLB的RoCEv2,此一差異便低於影響多數工作負載的門檻。
在哪些情況下仍應選擇 InfiniBand?
對於絕對延遲下限比total cost of ownership更重要的緊耦合HPC模擬,以及可接受single-vendor lock-in的封閉式單租戶叢集,請選擇InfiniBand。
在 AI fabric 中,Ethernet 何時更具優勢?
在多租戶 GPU-as-a-Service、與 data center 其餘部分共用同一維運模型和工具的叢集、對成本敏感的數千 GPU 規模建置,以及透過 coherent DCI 和 EVPN 跨 data center 延伸的 fabric 等場景中,Ethernet 更勝一籌。
OcNOS 如何縮小與 InfiniBand 的差距?
OcNOS-DC 目前提供 RoCEv2 lossless 傳輸、DLB 自適應路由以及 PFC 死結看門狗,於 7.1 中提供用於端到端路徑評分的 GLB,並隨 NIC 上市提供 UEC 支援,全部運行於 Edgecore、UfiSpace 等廠商的已驗證 open hardware 之上。
超大規模業者是否正以乙太網路取代 InfiniBand 來部署 AI?
大致上是的,不過 InfiniBand 並不會消失。根據 Dell'Oro Group 的資料,乙太網路在 AI 後端(向外擴展)交換領域已超越 InfiniBand,並在 2026 年初達到約三分之二的市場,較 InfiniBand 於 2023 年底約 80% 的占比大幅上升。Dell'Oro 也指出,隨著 NVIDIA Blackwell Ultra 800G 的量產,InfiniBand 出現強勁反彈,因此它在緊密耦合的 HPC 上仍是專門的選擇。Meta 曾描述在兩座各 24,576 顆 GPU 的叢集之一上,透過 RoCE 乙太網路網狀架構訓練其最大的模型。Ultra Ethernet Consortium 將此方向標準化,其指導成員包括 AMD、Arista、Broadcom、Cisco、Eviden、HPE、Intel、Meta、Microsoft 與 Oracle。理由是營運與經濟面的:與資料中心其餘部分共享的單一網路模式、多供應商供應鏈,以及在 400G 與 800G 下更低的每埠成本。
在 AI 叢集網路方面,InfiniBand 最佳的替代方案是什麼?
採用 RoCEv2 的乙太網路是主流替代方案。它運用 PFC、ECN 與 DCQCN 以無損方式承載 RDMA,透過 DLB 增添自適應路由,並隨著 UEC NIC 出貨透過 Ultra Ethernet 獲得封包散播與多路徑 RDMA。在運行 OcNOS-DC 的開放硬體上,它以多供應商堆疊而非單一供應商網狀架構來交付這一切。
Ultra Ethernet 與 InfiniBand 有何差異?
Ultra Ethernet(UEC)將定義了 InfiniBand 的傳輸技術帶到標準乙太網路上:跨所有路徑的封包散播、多路徑 RDMA、亂序遞送,以及選擇性重傳。於 2025 年 6 月發布的 UEC 1.0 規格定義了這項傳輸。差異在於生態系:InfiniBand 在 NIC 與交換晶片方面實質上是單一供應商,而 Ultra Ethernet 是任何供應商都能據以建構的開放、多供應商規格。
相較於 InfiniBand,乙太網路 AI 網狀架構的成本是多少?
交換層在 AI 叢集的整體擁有成本中占比不高,五年期間通常為個位數百分比,不過若計入 NIC、光模組與佈線,這個數字會上升。在同等容量下,單一供應商的 InfiniBand 相較於運行 OcNOS-DC 的開放硬體乙太網路,一般帶有價格溢價。更有意義的問題是省下的資本能投入什麼,無論是更多 GPU、更大的儲存層,或用於強化韌性的第二個站點。

正在為下一座叢集估算規模嗎?取得針對特定工作負載的評估

告訴我們工作負載與 GPU 規模,IP Infusion 的工程師將與您一同進行計算,或者您也可以先在 AI Fabric Design Suite 中初步規劃葉脊式配置。