Watchdog PFC · RoCEv2 · Lossless

PFC: rilevamento e ripristino deadlock

Un deadlock PFC è l'unico guasto che può bloccare indefinitamente una fabric lossless: una dipendenza ciclica dei buffer in cui code prioritarie in pausa si attendono a vicenda. Il watchdog di OcNOS-DC è per porta e per priorità. Rileva il ciclo di code in pausa e drena automaticamente la coda prima che i job si blocchino, su Broadcom Tomahawk 4 e Tomahawk 5.

Per-porte watchdog per priorità
Sub-secondrileva, drena, ripristina
TH4 & TH5Piattaforme Broadcom Tomahawk
Attivo per impostazione predefinitaTemplate lossless OcNOS-DC
Che aspetto ha un deadlock

Un ciclo di pausa a 3 switch

Tre switch in una dipendenza circolare. Ciascuno è in pausa sulla propria coda prioritaria lossless, in attesa che lo switch successivo si svuoti. Senza intervento, il ciclo è stabile per sempre. Il watchdog OcNOS scatta dopo il timeout configurato, drena la coda 3 sullo Switch-A e il ciclo collassa.

Ciclo di deadlock PFC e recovery tramite watchdog Three switches arranged in a triangle. Pause arrows point clockwise from each switch to the next, indicating each switch is paused waiting for the downstream switch. A watchdog icon at Switch-A shows the OcNOS deadlock timer firing to drain the queue and break the cycle. Pausa PFC (CoS 3) Pausa PFC Pausa PFC WD il watchdog scatta svuota la coda 3 Switch-Ain pausa su Q3in attesa di B Switch-Bin pausa su Q3in attesa di C Switch-Cin pausa su Q3in attesa di A PFC DEADLOCK · WATCHDOG TIMEOUT · QUEUE DRAIN · AUTO-RECOVERY
Come si forma

Come PFC genera un deadlock

PFC è ciò che rende RoCEv2 lossless e, su una topologia ben progettata, non causa mai problemi. La modalità di guasto si presenta solo quando un ciclo di code in pausa si chiude su una fabric multi-percorso.

PFC è una pausa hop-by-hop: uno switch invia una pausa al proprio upstream quando la sua coda di ingresso lossless supera la soglia, e l'upstream smette di trasmettere. Su una topologia ad albero con un'unica direzione di flusso, è sicuro. Su una fabric leaf-spine con percorsi multipli, il reinstradamento ECMP attorno a un guasto di link può, in condizioni specifiche, creare un percorso circolare in cui ogni switch è in pausa in attesa del successivo. Questa dipendenza ciclica dei buffer, code prioritarie in pausa che si attendono a vicenda, è un deadlock PFC.

Una volta formato, il ciclo è stabile: c'è buffer sufficiente per trattenere i frame in pausa, il protocollo di routing crede che tutto sia convergente e PFC continua a riattivarsi su ogni switch. Senza intervento, la priorità lossless interessata si blocca indefinitamente. Il traffico RoCEv2 si ferma, i collettivi xCCL (RCCL, oneCCL) vanno in timeout e il job di training si blocca.

Il meccanismo

Il watchdog OcNOS-DC

Un timer per porta e per priorità che rileva il ciclo di code in pausa e drena la coda interessata prima che i job si blocchino, per poi ripristinare autonomamente il normale PFC. Rilevamento, recupero e ripristino sono la triade centrale; telemetria, ottimizzazione e licensing la completano.

Detection

Timer per porta e per priorità

Un timer viene eseguito per porta di ingresso e per priorità lossless. Se la priorità resta in pausa in modo continuo per l'intervallo configurato (tipicamente da 100 a 400 ms), il watchdog scatta.

Recovery

Drain automatico delle code

All'attivazione, la coda di ingresso interessata viene drenata: alcuni frame vengono scartati temporaneamente per interrompere il ciclo. I frame scartati innescano ritrasmissioni dei collettivi xCCL, ma l'alternativa è un blocco a tempo indefinito.

Restoration

Ripristino automatico dopo il recovery

Trascorso l'intervallo di restore configurato, il normale funzionamento PFC riprende sulla priorità interessata. Nessun intervento dell'operatore richiesto; il fabric torna lossless nel giro di pochi secondi.

Telemetria

contatori gNMI

Gli eventi di attivazione del watchdog, le durate di drain e i contatori di pausa per priorità sono trasmessi via gNMI per un monitoraggio del fabric a ciclo chiuso. Gli SRE vedono gli eventi di deadlock come alert, non come stalli di training silenziosi.

Tunable

Timer configurabili dall'operatore

Il timeout di rilevamento, la durata di drain e l'intervallo di ripristino sono configurabili via CLI per porta e per priorità. I valori predefiniti funzionano per la maggior parte dei fabric; l'operatore può ridurre i timer sui cluster ad alto rischio.

Ambito

Tier di licenza DC-PLUS

Parte della SKU OcNOS-DC PLUS insieme al resto dello stack RoCEv2 lossless. Confermato sulle piattaforme Broadcom Tomahawk 4 e Tomahawk 5.

Lo stack circostante

Il watchdog è una rete di sicurezza sotto il resto dello stack lossless

Il miglior deadlock è quello che non si forma mai. Il controllo della congestione, il trasporto lossless che protegge e il routing adattivo mantengono innanzitutto le code lontane dalla soglia di pausa; il watchdog è l'ultima linea quando non ci riescono.

Controllo della congestione

DCQCN marca e regola il ritmo dei flussi con ECN prima che le code di ingresso raggiungano la soglia PFC, così la pausa viene attivata molto meno spesso e i cicli raramente hanno la possibilità di chiudersi.

Trasporto lossless

RoCEv2 è il trasporto RDMA che PFC esiste per proteggere. Il watchdog è ciò che rende sicuro, anziché teoricamente rischioso, eseguire RoCEv2 in modalità lossless su larga scala.

Routing adattivo

DLB effettua il rebind dei flowlet lontano dagli uplink congestionati in finestre inferiori al millisecondo, distribuendo il carico così che le code di ingresso abbiano meno probabilità di raggiungere la soglia che attiva la pausa.

Quando lo vedrete scattare

Raro non significa mai, ed è proprio questo il punto

In una fabric ben progettata con topologia e routing adeguati, i deadlock PFC sono rari e la maggior parte degli operatori non ne vede uno in anni di esercizio. Il watchdog è importante perché le condizioni possono comunque presentarsi, e quando accade la differenza si misura in ore.

Cosa lo attiva

Un guasto di link durante una finestra di convergenza del routing, una configurazione errata delle priorità PFC su una singola porta o un evento di congestione transitorio su un pattern di traffico insolito possono tutti creare le condizioni.

Senza il watchdog

Quando un deadlock si forma, il cluster IA si ferma e il team operativo ha ore di debug davanti a sé, alla ricerca di un blocco che il protocollo di routing segnala come integro.

Con il watchdog

Ottenete un breve burst di ritrasmissione e un evento registrato anziché un job bloccato. Progettate la topologia e i tier di switch che mantengono rari i deadlock con l'AI Fabric Sizing Tool.

In sintesi

Perché il watchdog rende PFC sicuro da implementare su larga scala

Trasforma l'unica obiezione teorica all'Ethernet lossless in un evento registrato e auto-risolvente che il vostro stack di osservabilità esistente rileva già.

  • Rete di sicurezza lossless. Il watchdog è la differenza tra "il PFC è teoricamente rischioso sulle fabric AI di produzione" e "il PFC è sicuro da implementare su larga scala."
  • Recupero in meno di un secondo. Rilevamento, drenaggio e ripristino si completano tipicamente entro un secondo. xCCL ritrasmette una piccola finestra di traffico RDMA; il job prosegue.
  • Configurazione standard. Il watchdog è attivo per impostazione predefinita nel template lossless OcNOS-DC. Non dovete ricordarvi di attivarlo.
  • Observable. Ogni attivazione viene registrata, conteggiata e trasmessa in streaming tramite gNMI per un monitoraggio a ciclo chiuso con il vostro stack di osservabilità esistente.
  • Regolabile in base alla posta in gioco. Abbassate i timer sui cluster di training critici; i valori predefiniti vanno bene per una fabric DC generica. Vedi PFC nella feature matrix and the elenco hardware validato.
FAQ

Deadlock PFC, le risposte

Che cosa provoca un deadlock PFC?
PFC è una pausa hop-by-hop. Su una fabric multi-percorso, il reinstradamento ECMP attorno a un guasto di link può, in condizioni specifiche, creare un percorso circolare in cui ogni switch è in pausa in attesa del successivo. La dipendenza ciclica dei buffer è stabile e la priorità lossless si blocca finché qualcosa non la interrompe.
In che modo il watchdog PFC di OcNOS ripristina la fabric?
Un timer per porta e per priorità si attiva se una priorità lossless rimane in pausa per l'intervallo configurato (in genere da 100 a 400 ms). Il watchdog svuota la coda interessata interrompendo il ciclo, quindi ripristina il PFC normale dopo l'intervallo di ripristino, senza intervento dell'operatore.
Il watchdog scarta traffico?
Sì, per un breve istante. Lo svuotamento della coda scarta una piccola finestra di frame, il che innesca ritrasmissioni collettive xCCL. L'alternativa è un blocco indefinito, per cui il compromesso è un burst di ritrasmissione inferiore al secondo a fronte di un job di training fermo.
Il watchdog anti-deadlock PFC è abilitato per impostazione predefinita?
Sì. Il watchdog è attivo per impostazione predefinita nel template lossless OcNOS-DC, con timer di rilevamento, drenaggio e ripristino configurabili da CLI. Fa parte dello SKU OcNOS-DC PLUS sulle piattaforme Broadcom Tomahawk 4 e Tomahawk 5.

Validare il comportamento lossless su una nuova fabric? Iniziate dal watchdog

Indicateci il carico di lavoro e la scala GPU, e un ingegnere di IP Infusion esaminerà con voi il vostro design lossless, oppure iniziate con un layout leaf-spine di primo passaggio nell'AI Fabric Design Suite.