RoCEv2 · PFC / ECN · DCQCN

RoCE vs InfiniBand per cluster AI

RoCEv2 esegue RDMA su Ethernet aperto e multi-vendor; InfiniBand è un fabric lossless a vendor singolo. RoCEv2 resta lossless con PFC ed ECN e controlla la congestione con DCQCN, mentre InfiniBand è lossless by design grazie al controllo di flusso basato su crediti. Per la maggior parte dei workload AI, Ethernet con RoCEv2 ora eguaglia InfiniBand mantenendo la scelta dell'hardware. Questa pagina li confronta asse per asse.

UDP 4791RDMA instradabile a Layer 3
fino a 800Gfabric RoCEv2 aperti
1 contractOcNOS-DC + hardware validato
600+reti operatore su OcNOS
Due fabric, due modi per restare lossless

Le stesse GPU, due modi per restare lossless

A sinistra: RoCEv2 su Ethernet mantiene le code poco profonde con pausa PFC hop dopo hop, marcatura ECN sullo switch e controllo della velocità DCQCN sulla NIC di invio. A destra: InfiniBand usa il controllo di flusso basato su crediti, inviando solo quando il ricevitore ha annunciato crediti di buffer. Entrambi evitano gli scarti; uno su Ethernet aperto e multi-vendor, l'altro su un fabric a vendor singolo.

RoCEv2 PFC/ECN/DCQCN loop versus InfiniBand credit-based flow control Two side-by-side diagrams. Left: a sending GPU NIC and a receiving GPU NIC connected through an Ethernet switch running OcNOS-DC. PFC pause acts hop-by-hop, the switch marks ECN on congestion, and a DCQCN signal returns to the sending NIC to lower its rate. Right: an InfiniBand switch and adapter exchanging buffer credits, so a sender transmits only when the receiver has advertised credit. Bottom band contrasts open multi-vendor Ethernet with a single-vendor InfiniBand fabric. RoCEv2 · OPEN ETHERNET INFINIBAND · SINGLE-VENDOR GPU NICsender SwitchOcNOS-DC · TH5 GPU NICreceiver ECN mark PFC pause (hop-by-hop) DCQCN rate control to sender PFC + ECN keep the fabric lossless · DCQCN controls congestion IB Switchsubnet manager GPU HCAIB adapter data (only if credits > 0) buffer credits Credit-based flow control · lossless by design · single ecosystem OPEN MULTI-VENDOR ETHERNET vs SINGLE-VENDOR INFINIBAND FABRIC
Come si confrontano

RoCE e InfiniBand, asse per asse

RoCE è RDMA over Converged Ethernet; la versione che conta per l'AI è RoCEv2, che incapsula RDMA in UDP/IP sulla porta di destinazione 4791 così che il traffico sia instradabile su un fabric Ethernet a Layer 3. InfiniBand è un'interconnessione appositamente progettata dell'InfiniBand Trade Association, lossless per architettura grazie al controllo di flusso basato su crediti. La domanda pratica per un cluster AI è quale trasporto soddisfi il workload mantenendo sensati i costi, la supply chain e le operazioni.

Axis RoCERoCEv2 su Ethernet, aperto InfiniBandfabric a vendor singolo
Transport & standardRDMA su UDP/IP (RoCEv2, IBTA), instradabile a Layer 3 sulla porta UDP di destinazione 4791. Viaggia su Ethernet IEEE standard.Livelli di link e di trasporto InfiniBand appositamente progettati (IBTA), con switch e host channel adapter dedicati.
Come resta losslessPFC per il controllo di flusso hop dopo hop più ECN con DCQCN per il controllo della congestione end-to-end, mantenendo poco profonde le code degli switch così che RDMA eviti gli scarti.Controllo di flusso basato su crediti: un mittente trasmette solo a fronte dei crediti di buffer annunciati dal ricevitore, quindi il fabric è lossless by design.
EcosistemaAperto e multi-vendor a ogni livello: ASIC dello switch, switch, NIC, NOS e ottiche da fornitori indipendenti.Di fatto a vendor singolo per il silicio di NIC e switch; il fabric, gli adattatori e la gestione arrivano come un unico stack.
Scelta del silicio dello switchBroadcom Tomahawk 5 (51.2 Tbps, 64x800G) e Tomahawk 4 (25.6 Tbps, 64x400G) su piattaforme Edgecore e UfiSpace, tra le altre.Silicio solo dal vendor InfiniBand; nessun ASIC o fornitura di switch indipendenti.
Controllo della congestioneDCQCN end-to-end: lo switch marca ECN e la NIC di invio riduce la propria velocità. Il bilanciamento del carico adattivo (DLB) distribuisce i flussi e li ribilancia in caso di congestione locale.Controllo di flusso basato su crediti con routing adattivo integrato nella specifica.
ScalareOn Tomahawk 5, a 2-tier fabric reaches roughly 2,048 GPUs at 1:1 (toward 8,000+ with 800G breakout); a 3-stage Clos extends to 16,000+ and up to about 65,536 endpoints.Scala tramite topologie fat-tree gestite da un subnet manager centralizzato all'interno del fabric di un unico vendor.
Operations & toolingOperazioni Ethernet standard: BGP, EVPN, telemetria gNMI/OpenConfig e la stessa automazione (Ansible, NETCONF) usata in tutto il data center.Strumenti InfiniBand specializzati e un subnet manager, separati dal resto del modello operativo del data center.
Lock-in di vendorNessuno intrinseco: combina hardware e software a piacere e approvvigiona la supply chain da una seconda fonte.Elevato: NIC, switch, cablaggio e gestione arrivano tipicamente da un unico vendor.
Cost trendGli spine su hardware aperto con OcNOS-DC a 400G e 800G battono nettamente i fabric a vendor singolo, e il divario si allarga man mano che le velocità delle porte aumentano.I prezzi a vendor singolo comportano un sovrapprezzo a parità di capacità.

InfiniBand è un marchio dell'InfiniBand Trade Association. NVIDIA e Mellanox sono marchi dei rispettivi proprietari. Questo confronto è fornito a scopo informativo e non implica affiliazione o approvazione.

La decisione

Dove ciascuno eccelle

La risposta giusta è specifica per il workload. Scegli InfiniBand dove il requisito è una soglia minima di latenza assoluta; scegli RoCE dove a decidere sono il modello operativo, i costi o la portata tra i siti.

InfiniBand è adatto quando

La soglia minima di latenza è la specifica

Simulazioni HPC strettamente accoppiate dove la soglia minima di latenza NIC-a-NIC assoluta conta più del costo totale di proprietà, e cluster single-tenant dedicati dove uno stack a vendor singolo è accettabile.

RoCE è adatto quando

Contano le operazioni e la supply chain

GPU-as-a-Service multi-tenant e back-end AI che condividono un unico modello operativo, un unico stack di strumenti e una supply chain multi-vendor con il resto del data center.

RoCE è adatto quando

Il costo per GPU è il fattore decisivo

Gli spine su hardware aperto più OcNOS-DC eliminano il sovrapprezzo di rete a vendor singolo. Su una build da diverse migliaia di GPU, è una quota rilevante del budget hardware.

RoCE è adatto quando

Il fabric si estende tra data center

Ethernet si estende naturalmente tra sale e regioni con ottiche coerenti 400G ZR/ZR+, senza un livello gateway a lunga distanza separato.

Il percorso aperto

Come OcNOS-DC realizza il percorso RoCEv2

OcNOS-DC fornisce il substrato Ethernet lossless che RoCEv2 richiede. Lo switch fornisce le primitive di prevenzione delle perdite e di congestione; RoCEv2 è il trasporto che gira sulla NIC. Queste sono capacità dello switch verificate oggi in OcNOS-DC.

Losslessness

PFC and ECN

Priority Flow Control, incluso PFC-con-QoS su Layer 3 con DCBX/LLDP, più ECN e Dynamic ECN così che i flussi RDMA mantengano code poco profonde senza scarti.

Congestion

Marcatura DCQCN

Lo switch marca ECN così che l'anello DCQCN end-to-end anello DCQCN NIC-più-switch possa limitare la velocità dei mittenti. ETS e WRED modellano e gestiscono le code che trasportano RDMA.

Bilanciamento del carico

DLB e RTAG7

Dynamic Load Balancing (inclusi Reactive Path Rebalance e Random Flow) con hashing RTAG7 distribuisce le collettive e le ribilancia in caso di congestione locale.

Resilienza

Protezione deadlock PFC

PFC Deadlock Detection and Recovery più il tuning dei buffer mantengono stabile il fabric lossless sotto la propagazione delle pause che PFC può creare.

Telemetria

gNMI / OpenConfig

Streaming La telemetria gNMI e OpenConfig offre visibilità per priorità per il tuning ad anello chiuso durante il bring-up del cluster e l'operatività a regime.

UEC-ready

Allineato con UEC 1.0

IP Infusion è un membro contributore dell'Ultra Ethernet Consortium e OcNOS-DC si allinea con il Profilo fabric UEC 1.0, così che il fabric prosegua come compatibile con UEC man mano che vengono distribuite le NIC compatibili con UEC. L'allineamento non è una dichiarazione di certificazione.

La scelta del silicio è aperta: OcNOS-DC gira su Edgecore AIS800-64D e UfiSpace S9321-64E / S9321-64EO (il -64EO aggiunge 400G ZR+) su Broadcom Tomahawk 5, e su Edgecore AS9736-64D su Tomahawk 4, tutte piattaforme on-chip e shared-buffer ottimizzate per RoCEv2. Un unico contratto IP Infusion copre il software e l'hardware validato, con un solo TAC e un solo SLA.

Perché il cambiamento

Perché molti operatori passano a Ethernet per i back-end AI

Il cambiamento è più operativo ed economico che legato alla latenza pura. Tre elementi si sommano rapidamente su una grande build: un unico modello di rete condiviso con il resto del data center, una supply chain multi-vendor e un costo per porta inferiore a 400G e 800G.

La scala è comprovata sul campo. Meta ha descritto l'addestramento dei suoi modelli più grandi su un fabric Ethernet RoCE su un cluster da 24,000 GPU, una dimensione un tempo ritenuta richiedere InfiniBand. Il bilanciamento del carico adattivo su Tomahawk 4 e Tomahawk 5 ridistribuisce i flussi in caso di congestione in tempo reale, così che un fabric ben gestito possa puntare a un utilizzo superiore al 90 percento dove l'hashing statico lo lascerebbe bloccato. Il novanta percento è un obiettivo di progettazione, non una garanzia misurata.

Il vantaggio residuo di InfiniBand, una soglia minima di latenza assoluta inferiore, conta ancora per un insieme di workload HPC strettamente accoppiati. Per la maggior parte delle collettive di training distribuito e di inferenza su larga scala, un fabric RoCEv2 correttamente ottimizzato si colloca sotto la soglia che cambia il tempo di completamento dei job, motivo per cui il caso operativo ed economico decide ora la maggior parte delle nuove build di back-end AI.

  • Un unico modello di rete condiviso con il resto del data center, così che competenze e strumenti si trasferiscano.
  • Una supply chain multi-vendor che ti consente di approvvigionare da una seconda fonte silicio, switch, NIC e ottiche.
  • Un costo per porta inferiore a 400G e 800G, liberando capitale per più GPU, un tier di storage più grande o un secondo sito.
In breve

Entrambi sono validi, e la maggior parte dei nuovi back-end AI approda su Ethernet

InfiniBand mantiene una soglia minima di latenza assoluta inferiore che un insieme di workload HPC strettamente accoppiati continuerà a pagare. Per la maggior parte delle build di back-end AI, il caso operativo ed economico decide a favore di RoCEv2 su Ethernet aperto.

Entrambi sono validi

InfiniBand mantiene una soglia minima di latenza assoluta inferiore che un insieme di workload HPC strettamente accoppiati continuerà a pagare.

RoCEv2 ha colmato il divario per l'AI

Con PFC, ECN, DCQCN e il bilanciamento del carico adattivo configurati correttamente, Ethernet eguaglia InfiniBand sulla maggior parte delle collettive di training distribuito mantenendo la scelta dell'hardware.

La decisione è di solito operativa

Un unico modello di rete, una supply chain multi-vendor e un costo per porta inferiore a 400G e 800G decidono la maggior parte delle nuove build di back-end AI.

OcNOS-DC è il percorso aperto

Primitive RoCEv2 verificate oggi, allineate con UEC 1.0 per il domani, su hardware aperto validato di Edgecore e UfiSpace, con un unico contratto, un solo TAC e un solo SLA.

Risorsa

Ottieni l'AI Fabric Reference Design

The full PDF: lossless RoCEv2 topology, switch and transceiver counts, validated platforms, and a DCQCN starting profile on OcNOS-DC.

Scarica il PDF
FAQ

FAQ RoCE vs InfiniBand

Qual è la differenza tra RoCE e InfiniBand?
RoCE (in pratica RoCEv2) trasporta RDMA su Ethernet e IP standard e instradabile, quindi riutilizza switch, NIC, ottiche e strumenti operativi che qualsiasi vendor può fornire. InfiniBand è un fabric separato appositamente progettato con propri switch, adattatori, cablaggio e subnet manager di un unico vendor. RoCEv2 mantiene il fabric lossless con PFC ed ECN e controlla la congestione con DCQCN, mentre InfiniBand si affida al controllo di flusso basato su crediti che è lossless by design.
Ethernet è veloce quanto InfiniBand per l'AI?
Per la maggior parte delle collettive di training distribuito su larga scala, sì. InfiniBand ha ancora una soglia minima di latenza assoluta inferiore di centinaia di nanosecondi, ma una volta che RoCEv2 è configurato con PFC, ECN, DCQCN e bilanciamento del carico adattivo, quel divario si colloca al di sotto del livello che cambia il tempo di completamento dei job per la maggioranza dei workload AI. Molti operatori ora eseguono grandi reti di back-end AI su Ethernet per questo motivo.
Che cos'è RoCEv2?
RoCEv2 (RDMA over Converged Ethernet versione 2) incapsula RDMA in UDP/IP sulla porta di destinazione 4791, così che il traffico RDMA sia instradabile su fabric Ethernet a Layer 3. Consente a GPU e storage di spostare i dati direttamente tra le memorie con bassa latenza e basso overhead della CPU, motivo per cui è il modo mainstream di eseguire RDMA su una rete Ethernet aperta e multi-vendor.
RoCE ha bisogno di un fabric lossless?
Sì. Le prestazioni di RoCEv2 crollano nettamente quando i pacchetti vengono scartati, quindi serve un fabric lossless o quasi lossless. Gli operatori lo forniscono con PFC per il controllo di flusso hop dopo hop ed ECN con DCQCN per il controllo della congestione end-to-end, mantenendo poco profonde le code degli switch così che i flussi RDMA evitino scarti e ritrasmissioni. Lo switch fornisce il substrato lossless; RoCEv2 è il trasporto che gira sulla NIC.
Posso eseguire RoCE su switch aperti?
Sì. RoCEv2 gira su silicio Ethernet standard. OcNOS-DC offre i building block RoCEv2 (PFC, PFC-con-QoS su Layer 3, ECN, Dynamic ECN, ETS, WRED, DLB, rilevamento e ripristino del deadlock PFC e telemetria gNMI/OpenConfig) su hardware aperto validato come le piattaforme Edgecore e UfiSpace basate su Broadcom Tomahawk 4 e Tomahawk 5. Un unico contratto IP Infusion copre il software e l'hardware validato.
E Ultra Ethernet?
Ultra Ethernet (UEC) è lo standard aperto che porta a Ethernet spray di pacchetti, RDMA multi-path, consegna fuori ordine e controllo della congestione moderno, restringendo ciò che InfiniBand un tempo faceva in modo esclusivo. IP Infusion è un membro contributore dell'Ultra Ethernet Consortium e OcNOS-DC si allinea oggi con il profilo fabric UEC 1.0, con il trasporto UEC completo che entra in funzione man mano che vengono distribuite le NIC compatibili con UEC. L'allineamento con il profilo non è una dichiarazione di certificazione.

Stai dimensionando un fabric RoCEv2 rispetto a InfiniBand? Facciamo i conti specifici per il tuo workload

Comunicaci il workload e la scala di GPU e un ingegnere IP Infusion farà i calcoli con te, oppure parti da un primo layout leaf-spine con l'AI Fabric Design Suite.