RoCE vs InfiniBand per cluster AI
RoCEv2 esegue RDMA su Ethernet aperto e multi-vendor; InfiniBand è un fabric lossless a vendor singolo. RoCEv2 resta lossless con PFC ed ECN e controlla la congestione con DCQCN, mentre InfiniBand è lossless by design grazie al controllo di flusso basato su crediti. Per la maggior parte dei workload AI, Ethernet con RoCEv2 ora eguaglia InfiniBand mantenendo la scelta dell'hardware. Questa pagina li confronta asse per asse.
Le stesse GPU, due modi per restare lossless
A sinistra: RoCEv2 su Ethernet mantiene le code poco profonde con pausa PFC hop dopo hop, marcatura ECN sullo switch e controllo della velocità DCQCN sulla NIC di invio. A destra: InfiniBand usa il controllo di flusso basato su crediti, inviando solo quando il ricevitore ha annunciato crediti di buffer. Entrambi evitano gli scarti; uno su Ethernet aperto e multi-vendor, l'altro su un fabric a vendor singolo.
RoCE e InfiniBand, asse per asse
RoCE è RDMA over Converged Ethernet; la versione che conta per l'AI è RoCEv2, che incapsula RDMA in UDP/IP sulla porta di destinazione 4791 così che il traffico sia instradabile su un fabric Ethernet a Layer 3. InfiniBand è un'interconnessione appositamente progettata dell'InfiniBand Trade Association, lossless per architettura grazie al controllo di flusso basato su crediti. La domanda pratica per un cluster AI è quale trasporto soddisfi il workload mantenendo sensati i costi, la supply chain e le operazioni.
| Axis | RoCERoCEv2 su Ethernet, aperto | InfiniBandfabric a vendor singolo |
|---|---|---|
| Transport & standard | RDMA su UDP/IP (RoCEv2, IBTA), instradabile a Layer 3 sulla porta UDP di destinazione 4791. Viaggia su Ethernet IEEE standard. | Livelli di link e di trasporto InfiniBand appositamente progettati (IBTA), con switch e host channel adapter dedicati. |
| Come resta lossless | PFC per il controllo di flusso hop dopo hop più ECN con DCQCN per il controllo della congestione end-to-end, mantenendo poco profonde le code degli switch così che RDMA eviti gli scarti. | Controllo di flusso basato su crediti: un mittente trasmette solo a fronte dei crediti di buffer annunciati dal ricevitore, quindi il fabric è lossless by design. |
| Ecosistema | Aperto e multi-vendor a ogni livello: ASIC dello switch, switch, NIC, NOS e ottiche da fornitori indipendenti. | Di fatto a vendor singolo per il silicio di NIC e switch; il fabric, gli adattatori e la gestione arrivano come un unico stack. |
| Scelta del silicio dello switch | Broadcom Tomahawk 5 (51.2 Tbps, 64x800G) e Tomahawk 4 (25.6 Tbps, 64x400G) su piattaforme Edgecore e UfiSpace, tra le altre. | Silicio solo dal vendor InfiniBand; nessun ASIC o fornitura di switch indipendenti. |
| Controllo della congestione | DCQCN end-to-end: lo switch marca ECN e la NIC di invio riduce la propria velocità. Il bilanciamento del carico adattivo (DLB) distribuisce i flussi e li ribilancia in caso di congestione locale. | Controllo di flusso basato su crediti con routing adattivo integrato nella specifica. |
| Scalare | On Tomahawk 5, a 2-tier fabric reaches roughly 2,048 GPUs at 1:1 (toward 8,000+ with 800G breakout); a 3-stage Clos extends to 16,000+ and up to about 65,536 endpoints. | Scala tramite topologie fat-tree gestite da un subnet manager centralizzato all'interno del fabric di un unico vendor. |
| Operations & tooling | Operazioni Ethernet standard: BGP, EVPN, telemetria gNMI/OpenConfig e la stessa automazione (Ansible, NETCONF) usata in tutto il data center. | Strumenti InfiniBand specializzati e un subnet manager, separati dal resto del modello operativo del data center. |
| Lock-in di vendor | Nessuno intrinseco: combina hardware e software a piacere e approvvigiona la supply chain da una seconda fonte. | Elevato: NIC, switch, cablaggio e gestione arrivano tipicamente da un unico vendor. |
| Cost trend | Gli spine su hardware aperto con OcNOS-DC a 400G e 800G battono nettamente i fabric a vendor singolo, e il divario si allarga man mano che le velocità delle porte aumentano. | I prezzi a vendor singolo comportano un sovrapprezzo a parità di capacità. |
InfiniBand è un marchio dell'InfiniBand Trade Association. NVIDIA e Mellanox sono marchi dei rispettivi proprietari. Questo confronto è fornito a scopo informativo e non implica affiliazione o approvazione.
Dove ciascuno eccelle
La risposta giusta è specifica per il workload. Scegli InfiniBand dove il requisito è una soglia minima di latenza assoluta; scegli RoCE dove a decidere sono il modello operativo, i costi o la portata tra i siti.
La soglia minima di latenza è la specifica
Simulazioni HPC strettamente accoppiate dove la soglia minima di latenza NIC-a-NIC assoluta conta più del costo totale di proprietà, e cluster single-tenant dedicati dove uno stack a vendor singolo è accettabile.
Contano le operazioni e la supply chain
GPU-as-a-Service multi-tenant e back-end AI che condividono un unico modello operativo, un unico stack di strumenti e una supply chain multi-vendor con il resto del data center.
Il costo per GPU è il fattore decisivo
Gli spine su hardware aperto più OcNOS-DC eliminano il sovrapprezzo di rete a vendor singolo. Su una build da diverse migliaia di GPU, è una quota rilevante del budget hardware.
Il fabric si estende tra data center
Ethernet si estende naturalmente tra sale e regioni con ottiche coerenti 400G ZR/ZR+, senza un livello gateway a lunga distanza separato.
Come OcNOS-DC realizza il percorso RoCEv2
OcNOS-DC fornisce il substrato Ethernet lossless che RoCEv2 richiede. Lo switch fornisce le primitive di prevenzione delle perdite e di congestione; RoCEv2 è il trasporto che gira sulla NIC. Queste sono capacità dello switch verificate oggi in OcNOS-DC.
PFC and ECN
Priority Flow Control, incluso PFC-con-QoS su Layer 3 con DCBX/LLDP, più ECN e Dynamic ECN così che i flussi RDMA mantengano code poco profonde senza scarti.
Marcatura DCQCN
Lo switch marca ECN così che l'anello DCQCN end-to-end anello DCQCN NIC-più-switch possa limitare la velocità dei mittenti. ETS e WRED modellano e gestiscono le code che trasportano RDMA.
DLB e RTAG7
Dynamic Load Balancing (inclusi Reactive Path Rebalance e Random Flow) con hashing RTAG7 distribuisce le collettive e le ribilancia in caso di congestione locale.
Protezione deadlock PFC
PFC Deadlock Detection and Recovery più il tuning dei buffer mantengono stabile il fabric lossless sotto la propagazione delle pause che PFC può creare.
gNMI / OpenConfig
Streaming La telemetria gNMI e OpenConfig offre visibilità per priorità per il tuning ad anello chiuso durante il bring-up del cluster e l'operatività a regime.
Allineato con UEC 1.0
IP Infusion è un membro contributore dell'Ultra Ethernet Consortium e OcNOS-DC si allinea con il Profilo fabric UEC 1.0, così che il fabric prosegua come compatibile con UEC man mano che vengono distribuite le NIC compatibili con UEC. L'allineamento non è una dichiarazione di certificazione.
La scelta del silicio è aperta: OcNOS-DC gira su Edgecore AIS800-64D e UfiSpace S9321-64E / S9321-64EO (il -64EO aggiunge 400G ZR+) su Broadcom Tomahawk 5, e su Edgecore AS9736-64D su Tomahawk 4, tutte piattaforme on-chip e shared-buffer ottimizzate per RoCEv2. Un unico contratto IP Infusion copre il software e l'hardware validato, con un solo TAC e un solo SLA.
Perché molti operatori passano a Ethernet per i back-end AI
Il cambiamento è più operativo ed economico che legato alla latenza pura. Tre elementi si sommano rapidamente su una grande build: un unico modello di rete condiviso con il resto del data center, una supply chain multi-vendor e un costo per porta inferiore a 400G e 800G.
La scala è comprovata sul campo. Meta ha descritto l'addestramento dei suoi modelli più grandi su un fabric Ethernet RoCE su un cluster da 24,000 GPU, una dimensione un tempo ritenuta richiedere InfiniBand. Il bilanciamento del carico adattivo su Tomahawk 4 e Tomahawk 5 ridistribuisce i flussi in caso di congestione in tempo reale, così che un fabric ben gestito possa puntare a un utilizzo superiore al 90 percento dove l'hashing statico lo lascerebbe bloccato. Il novanta percento è un obiettivo di progettazione, non una garanzia misurata.
Il vantaggio residuo di InfiniBand, una soglia minima di latenza assoluta inferiore, conta ancora per un insieme di workload HPC strettamente accoppiati. Per la maggior parte delle collettive di training distribuito e di inferenza su larga scala, un fabric RoCEv2 correttamente ottimizzato si colloca sotto la soglia che cambia il tempo di completamento dei job, motivo per cui il caso operativo ed economico decide ora la maggior parte delle nuove build di back-end AI.
- Un unico modello di rete condiviso con il resto del data center, così che competenze e strumenti si trasferiscano.
- Una supply chain multi-vendor che ti consente di approvvigionare da una seconda fonte silicio, switch, NIC e ottiche.
- Un costo per porta inferiore a 400G e 800G, liberando capitale per più GPU, un tier di storage più grande o un secondo sito.
Entrambi sono validi, e la maggior parte dei nuovi back-end AI approda su Ethernet
InfiniBand mantiene una soglia minima di latenza assoluta inferiore che un insieme di workload HPC strettamente accoppiati continuerà a pagare. Per la maggior parte delle build di back-end AI, il caso operativo ed economico decide a favore di RoCEv2 su Ethernet aperto.
Entrambi sono validi
InfiniBand mantiene una soglia minima di latenza assoluta inferiore che un insieme di workload HPC strettamente accoppiati continuerà a pagare.
RoCEv2 ha colmato il divario per l'AI
Con PFC, ECN, DCQCN e il bilanciamento del carico adattivo configurati correttamente, Ethernet eguaglia InfiniBand sulla maggior parte delle collettive di training distribuito mantenendo la scelta dell'hardware.
La decisione è di solito operativa
Un unico modello di rete, una supply chain multi-vendor e un costo per porta inferiore a 400G e 800G decidono la maggior parte delle nuove build di back-end AI.
OcNOS-DC è il percorso aperto
Primitive RoCEv2 verificate oggi, allineate con UEC 1.0 per il domani, su hardware aperto validato di Edgecore e UfiSpace, con un unico contratto, un solo TAC e un solo SLA.
Ottieni l'AI Fabric Reference Design
The full PDF: lossless RoCEv2 topology, switch and transceiver counts, validated platforms, and a DCQCN starting profile on OcNOS-DC.
Ottieni l'AI Fabric Reference Design
Modulo breve: il PDF verrà scaricato subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
FAQ RoCE vs InfiniBand
Qual è la differenza tra RoCE e InfiniBand?
Ethernet è veloce quanto InfiniBand per l'AI?
Che cos'è RoCEv2?
RoCE ha bisogno di un fabric lossless?
Posso eseguire RoCE su switch aperti?
E Ultra Ethernet?
Approfondite. Portatelo con voi.
Il datasheet di prodotto e download tecnici e sintetici che vanno oltre questa pagina.
Datasheet OcNOS-DC
Specifica completa di OcNOS-DC: il set di funzionalità EVPN-VXLAN e Ethernet for AI, gli SKU software, le piattaforme hardware supportate e la guida all'ordine della soluzione.
Ottieni il datasheetOcNOS 800G Lossless AI Fabric
Fabric RoCEv2 non bloccante su spine Broadcom Tomahawk 4/5: tier di SKU, piattaforme validate e architettura di deployment.
Scarica il briefEVPN-VXLAN data center fabric
Fabric leaf-spine per data center di livello carrier: IRB simmetrico, route Type-2/Type-5 e gateway anycast distribuito.
Scarica il briefDatasheet OcNOS-DC
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
OcNOS 800G Lossless AI Fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
EVPN-VXLAN data center fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
Stai dimensionando un fabric RoCEv2 rispetto a InfiniBand? Facciamo i conti specifici per il tuo workload
Comunicaci il workload e la scala di GPU e un ingegnere IP Infusion farà i calcoli con te, oppure parti da un primo layout leaf-spine con l'AI Fabric Design Suite.
Progettate l'intero fabric AI con OcNOS
Dal business case al calcolo del numero di porte, riprendete da qualunque punto della realizzazione.