RoCEv2: Ethernet lossless per AI fabric

RDMA over Converged Ethernet v2 è ciò che trasporta il traffico collettivo delle GPU attraverso le moderne AI fabric. OcNOS implementa l'intero toolkit RoCEv2 (PFC, ECN/DCQCN, load-balancing adattivo e telemetria per priorità) sull'hardware aperto supportato da 400G e 800G.

Topologia AI Fabric Rail

Una sezione rail compatta: due spine e due leaf che trasportano RoCEv2 tra quattro GPU. I frame di pausa PFC viaggiano hop-by-hop in caso di congestione, mentre ECN marca gli elephant flow per la reazione DCQCN alla sorgente.

Topologia AI fabric RoCEv2: due spine, due leaf e quattro GPU, con frecce di pausa PFC sul traffico RoCEv2 lossless
RoCEv2: AI fabric con due spine e due leaf che trasporta traffico GPU lossless con flusso di pausa PFC.

Perché RoCEv2 è importante per le AI fabric

Le collettive GPU (all-reduce, all-gather, all-to-all) generano elephant flows che saturano i singoli percorsi della fabric e richiedono una perdita prossima allo zero per mantenere efficienti i job di training. La perdita di un solo pacchetto su un collegamento 400G RoCEv2 comporta la ritrasmissione, da parte della NIC interessata, dell'intera finestra di invio RDMA, con un impatto misurabile in secondi di tempo di inattività della GPU. RoCEv2 trasforma una fabric leaf-spine in un trasporto lossless per questi carichi di lavoro, poggiando su tre pilastri: PFC (Priority Flow Control), ECN (Explicit Congestion Notification) e DCQCN (Data Center Quantized Congestion Notification). Per dimensionare i livelli di switch e il numero di porte del vostro cluster GPU, utilizzate il Strumento di dimensionamento AI Fabric.

L'implementazione RoCEv2 di OcNOS

PFC

Pausa per priorità

802.1Qbb PFC su code di priorità configurabili, abbinato a watchdog timer per rilevare condizioni di deadlock e ripristinarsi automaticamente prima che si propaghino.

ECN + DCQCN

Marcatura adattiva

Marcatura ECN basata su WRED a livello di coda con feedback reaction-point DCQCN. Valori predefiniti ottimizzati per i workload collettivi xCCL (NCCL / RCCL / oneCCL); override parametrico per stack RDMA personalizzati.

Load balancing

Flowlet adattivo

Il Dynamic Load Balancing (DLB) ridistribuisce i flowlet in caso di saturazione del link in intervalli sub-millisecondo. Elimina le collisioni di hashing statico che danneggiano le topologie simmetriche.

Telemetria

Statistiche di coda per priorità

Sensori di streaming gNMI per la profondità delle code, i contatori di pause PFC, i pacchetti marcati ECN e la rilevazione di microburst, esportati con granularità di 1 secondo.

Topologia

Fabric ottimizzate per rail

Validated for rail-aligned and scheduled-fabric topologies. Recipes for 256-4,096 GPU clusters using off-the-shelf 400G and 800G open switches.

Diagnostics

Verifica lossless

Diagnostica CLI per verificare end-to-end una configurazione lossless nota e funzionante: calcolo dell'headroom PFC, verifica delle soglie ECN e un test di incast sintetico.

Cosa offre OcNOS

  • Scelta hardware aperta. Esegua RoCEv2 su piattaforme UfiSpace, Edgecore, Wedge o Celestica con la stessa immagine NOS: nessun vendor lock-in per il livello fabric.
  • Parità di funzionalità dal primo giorno. L'LB adattivo, il tuning DCQCN e la telemetria ASIC-native non sono add-on a pagamento. Fanno parte della licenza OcNOS-DC di base.
  • Reference design. Configurazioni validate per le topologie AI fabric più diffuse: pubblichiamo le configurazioni e i risultati dei test.
  • Accesso engineering. Il livello di supporto premium include il dialogo diretto con il team OcNOS RoCEv2 durante il bring-up del fabric.

Stai costruendo o scalando una AI fabric?

Richiedi una Demo Tecnica →
FAQ

Domande frequenti

Che cos'è RoCEv2?
RoCEv2 (RDMA over Converged Ethernet version 2) trasporta il traffico RDMA su reti UDP/IP instradabili, consentendo ai server di spostare dati direttamente tra memorie con latenza molto bassa e ridotto overhead della CPU. È ampiamente utilizzato per cluster AI e storage ad alta velocità su fabric Ethernet.
Qual è la differenza tra RoCEv2 e RoCEv1?
RoCEv2 esegue RDMA su UDP/IP, per cui è instradabile attraverso reti Layer 3, mentre RoCEv1 gira direttamente su Ethernet (Layer 2) e resta all'interno di un unico dominio di broadcast. RoCEv2 scala verso fabric di data center instradate e più ampie, che RoCEv1 non è in grado di raggiungere.
RoCEv2 richiede una rete lossless?
RoCEv2 richiede un fabric lossless o quasi lossless, poiché le prestazioni RDMA calano bruscamente in caso di perdita di pacchetti. Gli operatori lo ottengono con il PFC per il controllo di flusso e l'ECN abbinato al DCQCN per il controllo della congestione, mantenendo le code poco profonde affinché i flussi RDMA evitino scarti e ritrasmissioni.
Quale porta UDP utilizza RoCEv2?
RoCEv2 utilizza la porta UDP di destinazione 4791, la porta riservata dalla IANA per il traffico RoCEv2. Poiché RDMA è incapsulato in UDP/IP, i pacchetti sono instradabili e la porta UDP di origine può essere variata come identificatore di flusso per distribuire il traffico sui percorsi ECMP.
Come si confronta RoCEv2 con InfiniBand?
RoCEv2 offre RDMA su Ethernet e IP standard, mentre InfiniBand è una fabric separata e dedicata, con i propri switch e adattatori. RoCEv2 riutilizza operazioni e apparati Ethernet, ragione per cui molte reti AI e di storage la adottano al posto di una fabric InfiniBand dedicata.