Dynamic Load Balancing: routing adattivo per AI Fabric

L'ECMP a hash statico è stato concepito per il traffico web north-south, non per le collective GPU. Il Dynamic Load Balancing (DLB) di OcNOS ridistribuisce i flowlet su percorsi meno congestionati a intervalli sub-millisecondo, colmando il divario tra Ethernet e InfiniBand per i carichi di training distribuito.

Adaptive Routing su una fabric Leaf-Spine

Uno slice a 4 spine e 2 leaf che trasporta traffico GPU AllReduce. Il DLB misura in tempo reale la profondità della coda di egress locale. Quando Spine-3 si satura, il leaf reinstrada il flowlet successivo su Spine-2, mantenendo bilanciati tutti e quattro gli uplink.

Dynamic Load Balancing su un fabric AI leaf-spine Un AI fabric con quattro spine e due leaf. I server GPU collegati ai leaf inviano flussi AllReduce. Tre percorsi spine trasportano flowlet bilanciati. Il quarto spine è congestionato (rosso) e il Dynamic Load Balancing ridistribuisce il flowlet successivo su uno spine meno carico. La banda inferiore riporta le metriche DLB: profondità delle code, utilizzo delle porte, rebind dei flowlet. Spine-3 congestionato → il flowlet successivo viene re-bound a Spine-2 Spine-1 coda 18% Spine-2 coda 22% Spine-3 coda 92% Spine-4 coda 25% Leaf-1 DLB · flowlet Leaf-2 DLB · flowlet GPU-0 GPU-1 GPU-2 GPU-3 DLB · QUEUE-DEPTH FEEDBACK · FLOWLET REBIND · CONGESTION-AWARE ECMP

Perché l'ECMP statico fallisce sui fabric AI

Lo standard ECMP seleziona una porta di uscita applicando l'hashing alla 5-tuple all'inizio del flusso e vincola il flusso a quella porta per tutta la sua durata. Sul traffico web north-south, milioni di flussi di breve durata, la legge dei grandi numeri uniforma l'utilizzo tra i percorsi. Su un fabric AI si ha invece un numero ridotto di elephant flows dai collettivi GPU (AllReduce, AllGather, All-to-All) che consumano ciascuno un intero uplink 400G o 800G per diversi secondi alla volta. Due elephant flow sottoposti ad hash sullo stesso uplink collideranno per tutta la durata dell'operazione, mentre un altro uplink resta inattivo.

The result is hash polarisation: measured fabric utilisation around 50-60% with random hot-spots, and tail-latency outliers that stall the entire training job. DLB closes this gap by re-evaluating the path decision on every flowlet, a sub-flow chunk delimited by a small inter-packet gap, using live egress queue-depth and port-utilisation telemetry from the ASIC. To size a leaf-spine fabric for your GPU cluster, use the Strumento di dimensionamento AI Fabric.

L'implementazione DLB di OcNOS

Rilevamento dei flowlet

Timer di gap sub-millisecondo

ASIC-native flowlet inactivity timer (typical 16-256 µs) splits long elephant flows into chunks safe to spray across paths without TCP/RoCEv2 reordering.

Qualità del percorso

Feedback in tempo reale sulla profondità delle code

DLB utilizza i segnali di occupazione delle code per porta di egress e di utilizzo dei link provenienti dalla pipeline Tomahawk per valutare in tempo reale ogni next-hop ECMP.

Re-bind

Selezione adattiva del next-hop

Al confine del flowlet viene selezionato il membro di qualità più elevata. La qualità dei membri viene ricalcolata ogni pochi microsecondi, così una spine satura esce dall'insieme dei candidati entro un singolo flowlet.

Lossless

Ottimizzato insieme a PFC ed ECN

DLB si integra con lo stack lossless RoCEv2 (PFC, ECN/DCQCN, calcolo dell'headroom), così il rebinding dei flowlet avviene prima che le pause frame si propaghino verso l'upstream.

Telemetria

esportazione gNMI

I conteggi dei rebind per member, le distribuzioni dei flowlet-gap e i punteggi di qualità dei member vengono trasmessi in streaming tramite gNMI dial-out per una messa a punto del fabric a ciclo chiuso.

Hardware

TH4 / TH5 nativo

Validato su piattaforme spine Broadcom Tomahawk 4 (25,6T) e Tomahawk 5 (51,2T), in configurazioni di porte 64×400G e 64×800G, senza alcuna penalità sul fast-path software.

Cosa offre DLB nelle AI fabric in produzione

  • Maggiore utilizzo. I benchmark di flowlet-rebalancing pubblicati dal settore portano l'utilizzo del fabric da circa il 55% su ECMP statico verso oltre il 90% sullo stesso hardware, senza acquistare ulteriori uplink.
  • Tail latency inferiore. Il tempo di completamento collettivo P99.9 si stringe perché nessun singolo link va in saturazione mentre altri restano inattivi.
  • Training più veloce. Meno tempo di inattività della GPU in attesa del rank più lento significa un miglioramento misurabile del wall-clock sui workload con elevato AllReduce.
  • Nessuna modifica alle NIC. Il DLB risiede nell'ASIC dello switch. Le NIC RoCEv2 esistenti e gli stack collettivi xCCL (NCCL / RCCL / oneCCL) ricevono una consegna in ordine corretta senza modifiche al codice.
  • Un'unica licenza. DLB fa parte dello SKU OcNOS-DC PLUS: stessa immagine, stesso contratto di supporto, nessun add-on per singola funzionalità.

Stai ottimizzando il DLB per la tua GPU fabric?

Richiedi una Demo Tecnica →
FAQ

Domande frequenti

Che cos'è un flowlet e perché il DLB lo utilizza?
Un flowlet è un frammento di sotto-flusso delimitato da un piccolo intervallo tra pacchetti. DLB rivaluta il percorso a ogni confine di flowlet anziché fissare un intero flusso, così il traffico si sposta su un uplink meno congestionato senza causare il riordinamento di RoCEv2 o TCP.
In cosa si differenzia il DLB dall'ECMP statico?
L'ECMP statico applica l'hash al 5-tuple all'avvio del flusso e lo fissa per l'intera durata, per cui due flussi elefante GPU possono collidere sullo stesso uplink mentre un altro resta inattivo. DLB valuta ogni next-hop in tempo reale in base alla profondità di coda corrente e riassegna i flowlet sul percorso migliore.
DLB richiede nuove NIC o modifiche alla mia libreria collettiva?
No. DLB gira nell'ASIC dello switch, quindi le NIC RoCEv2 esistenti e gli stack collettivi xCCL (NCCL, RCCL, oneCCL) ottengono una consegna corretta e in ordine, senza modifiche al codice.
Quale hardware supporta OcNOS DLB?
DLB è supportato sulle piattaforme Broadcom Tomahawk 4 (25,6T) e Tomahawk 5 (51,2T) nelle configurazioni 64x400G e 64x800G ed è incluso nello SKU OcNOS-DC PLUS senza componenti aggiuntivi per singola funzionalità.