Dynamic Load Balancing: routing adattivo per AI Fabric
Su un fabric AI, usa il Dynamic Load Balancing adattivo anziché l'ECMP a hash statico. DLB rivaluta il percorso a ogni flowlet, un blocco di sotto-flusso delimitato da un intervallo tra pacchetti, usando la telemetria live dell'ASIC su profondità delle code in uscita e utilizzo delle porte, così che le collettive GPU smettano di collidere su un singolo uplink. Gira nell'ASIC dello switch su Broadcom Tomahawk 4 e 5, senza modifiche alla NIC o alla libreria collettiva.
Routing adattivo su un fabric leaf-spine
Una slice a quattro spine e due leaf che trasporta traffico AllReduce GPU. DLB misura in tempo reale la profondità della coda locale in uscita. Quando Spine-3 si satura, il leaf ridistribuisce il flowlet successivo su uno spine meno carico, mantenendo bilanciati tutti e quattro gli uplink.
ECMP statico e DLB, asse per asse
L'ECMP standard esegue l'hash della 5-tupla all'inizio del flusso e fissa il flusso per la sua durata. Sul traffico web nord-sud, milioni di flussi di breve durata livellano l'utilizzo tra i percorsi. Su un fabric AI, una manciata di elephant flow GPU, ognuno che occupa un intero uplink 400G o 800G per secondi, causano la polarizzazione dell'hash: alcuni uplink si saturano mentre i percorsi paralleli restano inattivi. DLB rivaluta il percorso a ogni flowlet usando la telemetria live dell'ASIC.
| Axis | Static ECMPhash e fissaggio | DLBadattivo, per flowlet |
|---|---|---|
| Decisione di percorso | Esegue l'hash della 5-tupla una volta all'inizio del flusso e fissa il flusso per la sua intera durata. | Rivaluta il percorso a ogni confine di flowlet e sposta il traffico su un uplink meno congestionato. |
| Granularity | Intero flusso. Un'unica scelta di hash governa secondi di traffico elephant-flow. | Flowlet: un blocco di sotto-flusso delimitato da un piccolo intervallo tra pacchetti, sicuro da ridistribuire senza riordino. |
| Segnale di congestione | Nessuno. L'hash è cieco allo stato del link in tempo reale. | Telemetria live dell'ASIC su profondità della coda in uscita e utilizzo delle porte, ricalcolata ogni pochi microsecondi. |
| Sotto elephant flow GPU | Polarizzazione dell'hash: due elephant possono collidere su un uplink mentre un altro resta inattivo. | I membri saturi escono dall'insieme dei candidati entro un flowlet, così che gli uplink restino bilanciati. |
| Rischio di riordino | Nessuno; il flusso è fissato, ma al costo di hot spot e outlier di latenza di coda. | Nessuno in pratica; l'intervallo tra pacchetti fa sì che RoCEv2 e TCP vedano una corretta consegna in ordine. |
| NIC / libreria collettiva | Nessuna modifica; comportamento standard. | Nessuna modifica. Gira nell'ASIC dello switch, quindi le NIC RoCEv2 e gli stack xCCL restano intatti. |
| Hardware | Qualsiasi switch con capacità ECMP. | Broadcom Tomahawk 4 (25.6T) e Tomahawk 5 (51.2T) in configurazioni 64x400G e 64x800G. |
| Telemetria | Contatori di interfaccia standard. | Conteggi di ridistribuzione per membro, distribuzioni degli intervalli di flowlet e punteggi di qualità dei membri via gNMI. |
L'implementazione DLB di OcNOS
DLB non è un componente aggiuntivo del control plane. Gira nella pipeline di forwarding Broadcom, valutando ogni next-hop ECMP dai segnali di congestione live e ridistribuendo i flowlet in hardware, ottimizzato in coppia con lo stack lossless RoCEv2.
Timer di gap sub-millisecondo
Un timer di inattività dei flowlet ASIC-native (tipicamente da 16 a 256 µs) suddivide i lunghi elephant flow in blocchi sicuri da distribuire sui percorsi senza riordino di TCP o RoCEv2.
Feedback in tempo reale sulla profondità delle code
DLB utilizza i segnali di occupazione delle code per porta di egress e di utilizzo dei link provenienti dalla pipeline Tomahawk per valutare in tempo reale ogni next-hop ECMP.
Selezione adattiva del next-hop
A ogni confine di flowlet viene selezionato il membro di qualità più alta. La qualità dei membri viene ricalcolata ogni pochi microsecondi, così che uno spine saturo esca dall'insieme dei candidati entro un flowlet.
Ottimizzato insieme a PFC ed ECN
DLB si integra con lo stack lossless RoCEv2 (PFC, ECN/DCQCN, calcolo dell'headroom), così il rebinding dei flowlet avviene prima che le pause frame si propaghino verso l'upstream.
esportazione gNMI
I conteggi dei rebind per member, le distribuzioni dei flowlet-gap e i punteggi di qualità dei member vengono trasmessi in streaming tramite gNMI dial-out per una messa a punto del fabric a ciclo chiuso.
TH4 / TH5 nativo
Validato su piattaforme spine Broadcom Tomahawk 4 (25.6T) e Tomahawk 5 (51.2T), in configurazioni di porte 64x400G e 64x800G, senza penalità sul fast path software.
Dove si colloca DLB nel fabric
DLB è il livello single-hop e consapevole della congestione di un più ampio trasporto Ethernet aperto. Viaggia su RoCEv2 lossless, passa il testimone a GLB su tutto il fabric per lo scoring end-to-end e mantiene un percorso pulito verso Ultra Ethernet man mano che arrivano le NIC UEC.
Trasporto lossless sottostante
DLB ridistribuisce i flowlet sopra un Fabric lossless RoCEv2 (PFC, ECN, DCQCN), così che il routing adattivo e l'RDMA lossless siano ottimizzati insieme anziché in contrasto tra loro.
Scoring su tutto il fabric come passo successivo
Dove DLB valuta il next-hop locale, GLB (OcNOS 7.1) estende la decisione alla qualità del percorso end-to-end su tutto il fabric leaf-spine.
Un trasporto compatibile con lo spray dei pacchetti in arrivo
DLB è il ponte di routing adattivo verso Ultra Ethernet, il cui spray di pacchetti e RDMA multi-percorso portano la stessa idea nella NIC man mano che l'hardware UEC arriva sul mercato.
Cosa offre DLB nelle AI fabric in produzione
Tenendo i flowlet lontani dagli uplink congestionati che l'ECMP statico sovraccarica, DLB trasforma una fabric leaf-spine simmetrica in una che resta bilanciata sotto il traffico collettivo delle GPU.
- Maggiore utilizzo. Il ribilanciamento dei flowlet tiene il traffico lontano dagli uplink congestionati che l'ECMP statico sovraccarica, così una fabric ben gestita può puntare a un utilizzo superiore al 90 percento sullo stesso hardware, senza acquistare altri uplink.
- Tail latency inferiore. Il tempo di completamento collettivo P99.9 si stringe perché nessun singolo link va in saturazione mentre altri restano inattivi.
- Training più veloce. Meno tempo di inattività della GPU in attesa del rank più lento significa un miglioramento misurabile del wall-clock sui workload con elevato AllReduce.
- Nessuna modifica alle NIC. DLB risiede nell'ASIC dello switch. Le NIC RoCEv2 esistenti e gli stack collettivi xCCL (NCCL, RCCL, oneCCL) ottengono una consegna in ordine corretta senza modifiche al codice.
- Un'unica licenza. DLB fa parte dello SKU OcNOS-DC PLUS: stessa immagine, stesso contratto di supporto, nessun add-on per singola funzionalità.
Il routing adattivo è un requisito minimo per una fabric IA Ethernet
L'ECMP statico è stato costruito per il traffico web nord-sud. Quando una fabric trasporta i collettivi GPU, il routing adattivo fa la differenza tra uplink bilanciati e job di training bloccati, e OcNOS lo offre su hardware aperto già oggi.
L'ECMP da solo non basta
Una manciata di elephant flow mette in crisi l'hashing statico. La polarizzazione dell'hash lascia alcuni uplink saturi mentre percorsi paralleli restano inutilizzati.
DLB colma il divario di routing
La selezione del percorso per singolo flowlet, consapevole della congestione, mantiene bilanciata una fabric Ethernet sotto il traffico collettivo, uno degli aspetti in cui InfiniBand aveva un vantaggio.
OcNOS è l'abilitatore
DLB oggi, GLB in arrivo, UEC quando le NIC saranno disponibili. Un unico NOS su hardware aperto validato di fornitori come Edgecore e UfiSpace, senza modifiche alle NIC o alle librerie collettive.
Dynamic Load Balancing, le risposte
Che cos'è un flowlet e perché il DLB lo utilizza?
In cosa si differenzia il DLB dall'ECMP statico?
DLB richiede nuove NIC o modifiche alla mia libreria collettiva?
Quale hardware supporta OcNOS DLB?
Approfondite. Portatelo con voi.
Il datasheet di prodotto e download tecnici e sintetici che vanno oltre questa pagina.
Datasheet OcNOS-DC
Specifica completa di OcNOS-DC: il set di funzionalità EVPN-VXLAN e Ethernet for AI, gli SKU software, le piattaforme hardware supportate e la guida all'ordine della soluzione.
Ottieni il datasheetOcNOS 800G Lossless AI Fabric
Fabric RoCEv2 non bloccante su spine Broadcom Tomahawk 4/5: tier di SKU, piattaforme validate e architettura di deployment.
Scarica il briefEVPN-VXLAN data center fabric
Fabric leaf-spine per data center di livello carrier: IRB simmetrico, route Type-2/Type-5 e gateway anycast distribuito.
Scarica il briefDatasheet OcNOS-DC
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
OcNOS 800G Lossless AI Fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
EVPN-VXLAN data center fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
Ottimizzare DLB per la vostra fabric GPU? Richiedete una valutazione specifica per il carico di lavoro
Indicateci la scala GPU e il pattern collettivo, e un ingegnere di IP Infusion ottimizzerà con voi i timer dei flowlet e lo scoring dei percorsi, oppure iniziate con un layout leaf-spine di primo passaggio nell'AI Fabric Design Suite.
Progettate l'intero fabric AI con OcNOS
Dal business case al calcolo del numero di porte, riprendete da qualunque punto della realizzazione.