Routing adattivo · Flowlet · RoCEv2

Dynamic Load Balancing: routing adattivo per AI Fabric

Su un fabric AI, usa il Dynamic Load Balancing adattivo anziché l'ECMP a hash statico. DLB rivaluta il percorso a ogni flowlet, un blocco di sotto-flusso delimitato da un intervallo tra pacchetti, usando la telemetria live dell'ASIC su profondità delle code in uscita e utilizzo delle porte, così che le collettive GPU smettano di collidere su un singolo uplink. Gira nell'ASIC dello switch su Broadcom Tomahawk 4 e 5, senza modifiche alla NIC o alla libreria collettiva.

Per-flowletselezione adattiva del percorso
TH4 + TH5Broadcom Tomahawk 25.6T / 51.2T
0 modifiche alla NICgira nell'ASIC dello switch
1 SKUOcNOS-DC PLUS, nessun add-on
Il routing adattivo in azione

Routing adattivo su un fabric leaf-spine

Una slice a quattro spine e due leaf che trasporta traffico AllReduce GPU. DLB misura in tempo reale la profondità della coda locale in uscita. Quando Spine-3 si satura, il leaf ridistribuisce il flowlet successivo su uno spine meno carico, mantenendo bilanciati tutti e quattro gli uplink.

Dynamic Load Balancing su un fabric AI leaf-spine A four-spine, two-leaf AI fabric. GPU servers attached to the leaves send AllReduce flows. Three spine paths carry balanced flowlets. The fourth spine is congested, and Dynamic Load Balancing re-bins the next flowlet onto a less-loaded spine. Bottom band labels DLB metrics: queue depth, port utilisation, flowlet rebind. Spine-3 congested · next flowlet re-bound to Spine-2 Spine-1 coda 18% Spine-2 coda 22% Spine-3 coda 92% Spine-4 coda 25% Leaf-1 DLB · flowlet Leaf-2 DLB · flowlet GPU-0 GPU-1 GPU-2 GPU-3 DLB · QUEUE-DEPTH FEEDBACK · FLOWLET REBIND · CONGESTION-AWARE ECMP
Perché l'ECMP statico fallisce sui fabric AI

ECMP statico e DLB, asse per asse

L'ECMP standard esegue l'hash della 5-tupla all'inizio del flusso e fissa il flusso per la sua durata. Sul traffico web nord-sud, milioni di flussi di breve durata livellano l'utilizzo tra i percorsi. Su un fabric AI, una manciata di elephant flow GPU, ognuno che occupa un intero uplink 400G o 800G per secondi, causano la polarizzazione dell'hash: alcuni uplink si saturano mentre i percorsi paralleli restano inattivi. DLB rivaluta il percorso a ogni flowlet usando la telemetria live dell'ASIC.

Axis Static ECMPhash e fissaggio DLBadattivo, per flowlet
Decisione di percorsoEsegue l'hash della 5-tupla una volta all'inizio del flusso e fissa il flusso per la sua intera durata.Rivaluta il percorso a ogni confine di flowlet e sposta il traffico su un uplink meno congestionato.
GranularityIntero flusso. Un'unica scelta di hash governa secondi di traffico elephant-flow.Flowlet: un blocco di sotto-flusso delimitato da un piccolo intervallo tra pacchetti, sicuro da ridistribuire senza riordino.
Segnale di congestioneNessuno. L'hash è cieco allo stato del link in tempo reale.Telemetria live dell'ASIC su profondità della coda in uscita e utilizzo delle porte, ricalcolata ogni pochi microsecondi.
Sotto elephant flow GPUPolarizzazione dell'hash: due elephant possono collidere su un uplink mentre un altro resta inattivo.I membri saturi escono dall'insieme dei candidati entro un flowlet, così che gli uplink restino bilanciati.
Rischio di riordinoNessuno; il flusso è fissato, ma al costo di hot spot e outlier di latenza di coda.Nessuno in pratica; l'intervallo tra pacchetti fa sì che RoCEv2 e TCP vedano una corretta consegna in ordine.
NIC / libreria collettivaNessuna modifica; comportamento standard.Nessuna modifica. Gira nell'ASIC dello switch, quindi le NIC RoCEv2 e gli stack xCCL restano intatti.
HardwareQualsiasi switch con capacità ECMP.Broadcom Tomahawk 4 (25.6T) e Tomahawk 5 (51.2T) in configurazioni 64x400G e 64x800G.
TelemetriaContatori di interfaccia standard.Conteggi di ridistribuzione per membro, distribuzioni degli intervalli di flowlet e punteggi di qualità dei membri via gNMI.
All'interno dell'implementazione

L'implementazione DLB di OcNOS

DLB non è un componente aggiuntivo del control plane. Gira nella pipeline di forwarding Broadcom, valutando ogni next-hop ECMP dai segnali di congestione live e ridistribuendo i flowlet in hardware, ottimizzato in coppia con lo stack lossless RoCEv2.

Rilevamento dei flowlet

Timer di gap sub-millisecondo

Un timer di inattività dei flowlet ASIC-native (tipicamente da 16 a 256 µs) suddivide i lunghi elephant flow in blocchi sicuri da distribuire sui percorsi senza riordino di TCP o RoCEv2.

Qualità del percorso

Feedback in tempo reale sulla profondità delle code

DLB utilizza i segnali di occupazione delle code per porta di egress e di utilizzo dei link provenienti dalla pipeline Tomahawk per valutare in tempo reale ogni next-hop ECMP.

Re-bind

Selezione adattiva del next-hop

A ogni confine di flowlet viene selezionato il membro di qualità più alta. La qualità dei membri viene ricalcolata ogni pochi microsecondi, così che uno spine saturo esca dall'insieme dei candidati entro un flowlet.

Lossless

Ottimizzato insieme a PFC ed ECN

DLB si integra con lo stack lossless RoCEv2 (PFC, ECN/DCQCN, calcolo dell'headroom), così il rebinding dei flowlet avviene prima che le pause frame si propaghino verso l'upstream.

Telemetria

esportazione gNMI

I conteggi dei rebind per member, le distribuzioni dei flowlet-gap e i punteggi di qualità dei member vengono trasmessi in streaming tramite gNMI dial-out per una messa a punto del fabric a ciclo chiuso.

Hardware

TH4 / TH5 nativo

Validato su piattaforme spine Broadcom Tomahawk 4 (25.6T) e Tomahawk 5 (51.2T), in configurazioni di porte 64x400G e 64x800G, senza penalità sul fast path software.

Parte dello stack di routing adattivo

Dove si colloca DLB nel fabric

DLB è il livello single-hop e consapevole della congestione di un più ampio trasporto Ethernet aperto. Viaggia su RoCEv2 lossless, passa il testimone a GLB su tutto il fabric per lo scoring end-to-end e mantiene un percorso pulito verso Ultra Ethernet man mano che arrivano le NIC UEC.

Trasporto lossless sottostante

DLB ridistribuisce i flowlet sopra un Fabric lossless RoCEv2 (PFC, ECN, DCQCN), così che il routing adattivo e l'RDMA lossless siano ottimizzati insieme anziché in contrasto tra loro.

Scoring su tutto il fabric come passo successivo

Dove DLB valuta il next-hop locale, GLB (OcNOS 7.1) estende la decisione alla qualità del percorso end-to-end su tutto il fabric leaf-spine.

Un trasporto compatibile con lo spray dei pacchetti in arrivo

DLB è il ponte di routing adattivo verso Ultra Ethernet, il cui spray di pacchetti e RDMA multi-percorso portano la stessa idea nella NIC man mano che l'hardware UEC arriva sul mercato.

In produzione

Cosa offre DLB nelle AI fabric in produzione

Tenendo i flowlet lontani dagli uplink congestionati che l'ECMP statico sovraccarica, DLB trasforma una fabric leaf-spine simmetrica in una che resta bilanciata sotto il traffico collettivo delle GPU.

  • Maggiore utilizzo. Il ribilanciamento dei flowlet tiene il traffico lontano dagli uplink congestionati che l'ECMP statico sovraccarica, così una fabric ben gestita può puntare a un utilizzo superiore al 90 percento sullo stesso hardware, senza acquistare altri uplink.
  • Tail latency inferiore. Il tempo di completamento collettivo P99.9 si stringe perché nessun singolo link va in saturazione mentre altri restano inattivi.
  • Training più veloce. Meno tempo di inattività della GPU in attesa del rank più lento significa un miglioramento misurabile del wall-clock sui workload con elevato AllReduce.
  • Nessuna modifica alle NIC. DLB risiede nell'ASIC dello switch. Le NIC RoCEv2 esistenti e gli stack collettivi xCCL (NCCL, RCCL, oneCCL) ottengono una consegna in ordine corretta senza modifiche al codice.
  • Un'unica licenza. DLB fa parte dello SKU OcNOS-DC PLUS: stessa immagine, stesso contratto di supporto, nessun add-on per singola funzionalità.
La visione di IP Infusion

Il routing adattivo è un requisito minimo per una fabric IA Ethernet

L'ECMP statico è stato costruito per il traffico web nord-sud. Quando una fabric trasporta i collettivi GPU, il routing adattivo fa la differenza tra uplink bilanciati e job di training bloccati, e OcNOS lo offre su hardware aperto già oggi.

L'ECMP da solo non basta

Una manciata di elephant flow mette in crisi l'hashing statico. La polarizzazione dell'hash lascia alcuni uplink saturi mentre percorsi paralleli restano inutilizzati.

DLB colma il divario di routing

La selezione del percorso per singolo flowlet, consapevole della congestione, mantiene bilanciata una fabric Ethernet sotto il traffico collettivo, uno degli aspetti in cui InfiniBand aveva un vantaggio.

OcNOS è l'abilitatore

DLB oggi, GLB in arrivo, UEC quando le NIC saranno disponibili. Un unico NOS su hardware aperto validato di fornitori come Edgecore e UfiSpace, senza modifiche alle NIC o alle librerie collettive.

FAQ

Dynamic Load Balancing, le risposte

Che cos'è un flowlet e perché il DLB lo utilizza?
Un flowlet è un frammento di sotto-flusso delimitato da un piccolo intervallo tra pacchetti. DLB rivaluta il percorso a ogni confine di flowlet anziché fissare un intero flusso, così il traffico si sposta su un uplink meno congestionato senza causare il riordinamento di RoCEv2 o TCP.
In cosa si differenzia il DLB dall'ECMP statico?
L'ECMP statico calcola l'hash della 5-tupla all'avvio del flusso e vincola il flusso per tutta la sua durata, così due elephant flow GPU possono collidere su un uplink mentre un altro resta inutilizzato. Questa polarizzazione dell'hash lascia saturare alcuni uplink mentre percorsi paralleli restano inattivi. DLB assegna un punteggio a ogni next-hop in tempo reale usando la profondità della coda e l'utilizzo delle porte in tempo reale, e riassegna i flowlet sul percorso migliore.
DLB richiede nuove NIC o modifiche alla mia libreria collettiva?
No. DLB gira nell'ASIC dello switch, quindi le NIC RoCEv2 esistenti e gli stack collettivi xCCL (NCCL, RCCL, oneCCL) ottengono una consegna corretta e in ordine, senza modifiche al codice.
Quale hardware supporta OcNOS DLB?
DLB è supportato sulle piattaforme Broadcom Tomahawk 4 (25,6T) e Tomahawk 5 (51,2T) nelle configurazioni 64x400G e 64x800G ed è incluso nello SKU OcNOS-DC PLUS senza componenti aggiuntivi per singola funzionalità.

Ottimizzare DLB per la vostra fabric GPU? Richiedete una valutazione specifica per il carico di lavoro

Indicateci la scala GPU e il pattern collettivo, e un ingegnere di IP Infusion ottimizzerà con voi i timer dei flowlet e lo scoring dei percorsi, oppure iniziate con un layout leaf-spine di primo passaggio nell'AI Fabric Design Suite.