Dynamic Load Balancing: routing adattivo per AI Fabric
L'ECMP a hash statico è stato concepito per il traffico web north-south, non per le collective GPU. Il Dynamic Load Balancing (DLB) di OcNOS ridistribuisce i flowlet su percorsi meno congestionati a intervalli sub-millisecondo, colmando il divario tra Ethernet e InfiniBand per i carichi di training distribuito.
Adaptive Routing su una fabric Leaf-Spine
Uno slice a 4 spine e 2 leaf che trasporta traffico GPU AllReduce. Il DLB misura in tempo reale la profondità della coda di egress locale. Quando Spine-3 si satura, il leaf reinstrada il flowlet successivo su Spine-2, mantenendo bilanciati tutti e quattro gli uplink.
Perché l'ECMP statico fallisce sui fabric AI
Lo standard ECMP seleziona una porta di uscita applicando l'hashing alla 5-tuple all'inizio del flusso e vincola il flusso a quella porta per tutta la sua durata. Sul traffico web north-south, milioni di flussi di breve durata, la legge dei grandi numeri uniforma l'utilizzo tra i percorsi. Su un fabric AI si ha invece un numero ridotto di elephant flows dai collettivi GPU (AllReduce, AllGather, All-to-All) che consumano ciascuno un intero uplink 400G o 800G per diversi secondi alla volta. Due elephant flow sottoposti ad hash sullo stesso uplink collideranno per tutta la durata dell'operazione, mentre un altro uplink resta inattivo.
The result is hash polarisation: measured fabric utilisation around 50-60% with random hot-spots, and tail-latency outliers that stall the entire training job. DLB closes this gap by re-evaluating the path decision on every flowlet, a sub-flow chunk delimited by a small inter-packet gap, using live egress queue-depth and port-utilisation telemetry from the ASIC. To size a leaf-spine fabric for your GPU cluster, use the Strumento di dimensionamento AI Fabric.
L'implementazione DLB di OcNOS
Timer di gap sub-millisecondo
ASIC-native flowlet inactivity timer (typical 16-256 µs) splits long elephant flows into chunks safe to spray across paths without TCP/RoCEv2 reordering.
Feedback in tempo reale sulla profondità delle code
DLB utilizza i segnali di occupazione delle code per porta di egress e di utilizzo dei link provenienti dalla pipeline Tomahawk per valutare in tempo reale ogni next-hop ECMP.
Selezione adattiva del next-hop
Al confine del flowlet viene selezionato il membro di qualità più elevata. La qualità dei membri viene ricalcolata ogni pochi microsecondi, così una spine satura esce dall'insieme dei candidati entro un singolo flowlet.
Ottimizzato insieme a PFC ed ECN
DLB si integra con lo stack lossless RoCEv2 (PFC, ECN/DCQCN, calcolo dell'headroom), così il rebinding dei flowlet avviene prima che le pause frame si propaghino verso l'upstream.
esportazione gNMI
I conteggi dei rebind per member, le distribuzioni dei flowlet-gap e i punteggi di qualità dei member vengono trasmessi in streaming tramite gNMI dial-out per una messa a punto del fabric a ciclo chiuso.
TH4 / TH5 nativo
Validato su piattaforme spine Broadcom Tomahawk 4 (25,6T) e Tomahawk 5 (51,2T), in configurazioni di porte 64×400G e 64×800G, senza alcuna penalità sul fast-path software.
Cosa offre DLB nelle AI fabric in produzione
- Maggiore utilizzo. I benchmark di flowlet-rebalancing pubblicati dal settore portano l'utilizzo del fabric da circa il 55% su ECMP statico verso oltre il 90% sullo stesso hardware, senza acquistare ulteriori uplink.
- Tail latency inferiore. Il tempo di completamento collettivo P99.9 si stringe perché nessun singolo link va in saturazione mentre altri restano inattivi.
- Training più veloce. Meno tempo di inattività della GPU in attesa del rank più lento significa un miglioramento misurabile del wall-clock sui workload con elevato AllReduce.
- Nessuna modifica alle NIC. Il DLB risiede nell'ASIC dello switch. Le NIC RoCEv2 esistenti e gli stack collettivi xCCL (NCCL / RCCL / oneCCL) ricevono una consegna in ordine corretta senza modifiche al codice.
- Un'unica licenza. DLB fa parte dello SKU OcNOS-DC PLUS: stessa immagine, stesso contratto di supporto, nessun add-on per singola funzionalità.
Stai ottimizzando il DLB per la tua GPU fabric?
Richiedi una Demo Tecnica →Domande frequenti
Che cos'è un flowlet e perché il DLB lo utilizza?
In cosa si differenzia il DLB dall'ECMP statico?
DLB richiede nuove NIC o modifiche alla mia libreria collettiva?
Quale hardware supporta OcNOS DLB?
Approfondite. Portatelo con voi.
Due download tecnici e concisi che approfondiscono oltre questa pagina: l'architettura del fabric AI 800G lossless e il riferimento di data center EVPN-VXLAN.
OcNOS 800G Lossless AI Fabric
Fabric RoCEv2 non bloccante su spine Broadcom Tomahawk 4/5: tier di SKU, piattaforme validate e architettura di deployment.
Scarica il briefEVPN-VXLAN data center fabric
Fabric di data center leaf-spine carrier-grade: IRB simmetrico, route Type-2/Type-5 e gateway anycast distribuito.
Scarica il briefOcNOS 800G Lossless AI Fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
Solution_Brief-OcNOS_800G_Ethernet-Based_Lossless_AI_Fabric.pdfEVPN-VXLAN data center fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
OcNOS-modernize-your-data-center-EVPN-VxLAN_Solution-Brief.pdfDesign the whole AI fabric with OcNOS
From the business case to the port-count maths, pick up wherever you are in the build.