PFC: rilevamento e ripristino deadlock
Un deadlock PFC è l'unico guasto che può bloccare indefinitamente una fabric lossless: una dipendenza ciclica dei buffer in cui code prioritarie in pausa si attendono a vicenda. Il watchdog di OcNOS-DC è per porta e per priorità. Rileva il ciclo di code in pausa e drena automaticamente la coda prima che i job si blocchino, su Broadcom Tomahawk 4 e Tomahawk 5.
Un ciclo di pausa a 3 switch
Tre switch in una dipendenza circolare. Ciascuno è in pausa sulla propria coda prioritaria lossless, in attesa che lo switch successivo si svuoti. Senza intervento, il ciclo è stabile per sempre. Il watchdog OcNOS scatta dopo il timeout configurato, drena la coda 3 sullo Switch-A e il ciclo collassa.
Come PFC genera un deadlock
PFC è ciò che rende RoCEv2 lossless e, su una topologia ben progettata, non causa mai problemi. La modalità di guasto si presenta solo quando un ciclo di code in pausa si chiude su una fabric multi-percorso.
PFC è una pausa hop-by-hop: uno switch invia una pausa al proprio upstream quando la sua coda di ingresso lossless supera la soglia, e l'upstream smette di trasmettere. Su una topologia ad albero con un'unica direzione di flusso, è sicuro. Su una fabric leaf-spine con percorsi multipli, il reinstradamento ECMP attorno a un guasto di link può, in condizioni specifiche, creare un percorso circolare in cui ogni switch è in pausa in attesa del successivo. Questa dipendenza ciclica dei buffer, code prioritarie in pausa che si attendono a vicenda, è un deadlock PFC.
Una volta formato, il ciclo è stabile: c'è buffer sufficiente per trattenere i frame in pausa, il protocollo di routing crede che tutto sia convergente e PFC continua a riattivarsi su ogni switch. Senza intervento, la priorità lossless interessata si blocca indefinitamente. Il traffico RoCEv2 si ferma, i collettivi xCCL (RCCL, oneCCL) vanno in timeout e il job di training si blocca.
Il watchdog OcNOS-DC
Un timer per porta e per priorità che rileva il ciclo di code in pausa e drena la coda interessata prima che i job si blocchino, per poi ripristinare autonomamente il normale PFC. Rilevamento, recupero e ripristino sono la triade centrale; telemetria, ottimizzazione e licensing la completano.
Timer per porta e per priorità
Un timer viene eseguito per porta di ingresso e per priorità lossless. Se la priorità resta in pausa in modo continuo per l'intervallo configurato (tipicamente da 100 a 400 ms), il watchdog scatta.
Drain automatico delle code
All'attivazione, la coda di ingresso interessata viene drenata: alcuni frame vengono scartati temporaneamente per interrompere il ciclo. I frame scartati innescano ritrasmissioni dei collettivi xCCL, ma l'alternativa è un blocco a tempo indefinito.
Ripristino automatico dopo il recovery
Trascorso l'intervallo di restore configurato, il normale funzionamento PFC riprende sulla priorità interessata. Nessun intervento dell'operatore richiesto; il fabric torna lossless nel giro di pochi secondi.
contatori gNMI
Gli eventi di attivazione del watchdog, le durate di drain e i contatori di pausa per priorità sono trasmessi via gNMI per un monitoraggio del fabric a ciclo chiuso. Gli SRE vedono gli eventi di deadlock come alert, non come stalli di training silenziosi.
Timer configurabili dall'operatore
Il timeout di rilevamento, la durata di drain e l'intervallo di ripristino sono configurabili via CLI per porta e per priorità. I valori predefiniti funzionano per la maggior parte dei fabric; l'operatore può ridurre i timer sui cluster ad alto rischio.
Tier di licenza DC-PLUS
Parte della SKU OcNOS-DC PLUS insieme al resto dello stack RoCEv2 lossless. Confermato sulle piattaforme Broadcom Tomahawk 4 e Tomahawk 5.
Il watchdog è una rete di sicurezza sotto il resto dello stack lossless
Il miglior deadlock è quello che non si forma mai. Il controllo della congestione, il trasporto lossless che protegge e il routing adattivo mantengono innanzitutto le code lontane dalla soglia di pausa; il watchdog è l'ultima linea quando non ci riescono.
Controllo della congestione
DCQCN marca e regola il ritmo dei flussi con ECN prima che le code di ingresso raggiungano la soglia PFC, così la pausa viene attivata molto meno spesso e i cicli raramente hanno la possibilità di chiudersi.
Trasporto lossless
RoCEv2 è il trasporto RDMA che PFC esiste per proteggere. Il watchdog è ciò che rende sicuro, anziché teoricamente rischioso, eseguire RoCEv2 in modalità lossless su larga scala.
Routing adattivo
DLB effettua il rebind dei flowlet lontano dagli uplink congestionati in finestre inferiori al millisecondo, distribuendo il carico così che le code di ingresso abbiano meno probabilità di raggiungere la soglia che attiva la pausa.
Raro non significa mai, ed è proprio questo il punto
In una fabric ben progettata con topologia e routing adeguati, i deadlock PFC sono rari e la maggior parte degli operatori non ne vede uno in anni di esercizio. Il watchdog è importante perché le condizioni possono comunque presentarsi, e quando accade la differenza si misura in ore.
Cosa lo attiva
Un guasto di link durante una finestra di convergenza del routing, una configurazione errata delle priorità PFC su una singola porta o un evento di congestione transitorio su un pattern di traffico insolito possono tutti creare le condizioni.
Senza il watchdog
Quando un deadlock si forma, il cluster IA si ferma e il team operativo ha ore di debug davanti a sé, alla ricerca di un blocco che il protocollo di routing segnala come integro.
Con il watchdog
Ottenete un breve burst di ritrasmissione e un evento registrato anziché un job bloccato. Progettate la topologia e i tier di switch che mantengono rari i deadlock con l'AI Fabric Sizing Tool.
Perché il watchdog rende PFC sicuro da implementare su larga scala
Trasforma l'unica obiezione teorica all'Ethernet lossless in un evento registrato e auto-risolvente che il vostro stack di osservabilità esistente rileva già.
- Rete di sicurezza lossless. Il watchdog è la differenza tra "il PFC è teoricamente rischioso sulle fabric AI di produzione" e "il PFC è sicuro da implementare su larga scala."
- Recupero in meno di un secondo. Rilevamento, drenaggio e ripristino si completano tipicamente entro un secondo. xCCL ritrasmette una piccola finestra di traffico RDMA; il job prosegue.
- Configurazione standard. Il watchdog è attivo per impostazione predefinita nel template lossless OcNOS-DC. Non dovete ricordarvi di attivarlo.
- Observable. Ogni attivazione viene registrata, conteggiata e trasmessa in streaming tramite gNMI per un monitoraggio a ciclo chiuso con il vostro stack di osservabilità esistente.
- Regolabile in base alla posta in gioco. Abbassate i timer sui cluster di training critici; i valori predefiniti vanno bene per una fabric DC generica. Vedi PFC nella feature matrix and the elenco hardware validato.
Deadlock PFC, le risposte
Che cosa provoca un deadlock PFC?
In che modo il watchdog PFC di OcNOS ripristina la fabric?
Il watchdog scarta traffico?
Il watchdog anti-deadlock PFC è abilitato per impostazione predefinita?
Approfondite. Portatelo con voi.
Il datasheet di prodotto e download tecnici e sintetici che vanno oltre questa pagina.
Datasheet OcNOS-DC
Specifica completa di OcNOS-DC: il set di funzionalità EVPN-VXLAN e Ethernet for AI, gli SKU software, le piattaforme hardware supportate e la guida all'ordine della soluzione.
Ottieni il datasheetOcNOS 800G Lossless AI Fabric
Fabric RoCEv2 non bloccante su spine Broadcom Tomahawk 4/5: tier di SKU, piattaforme validate e architettura di deployment.
Scarica il briefEVPN-VXLAN data center fabric
Fabric leaf-spine per data center di livello carrier: IRB simmetrico, route Type-2/Type-5 e gateway anycast distribuito.
Scarica il briefDatasheet OcNOS-DC
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
OcNOS 800G Lossless AI Fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
EVPN-VXLAN data center fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
Validare il comportamento lossless su una nuova fabric? Iniziate dal watchdog
Indicateci il carico di lavoro e la scala GPU, e un ingegnere di IP Infusion esaminerà con voi il vostro design lossless, oppure iniziate con un layout leaf-spine di primo passaggio nell'AI Fabric Design Suite.
Progettate l'intero fabric AI con OcNOS
Dal business case al calcolo del numero di porte, riprendete da qualunque punto della realizzazione.