PFC Deadlock Detection & Recovery

La pausa PFC è ciò che rende lossless RoCEv2, ma in rare condizioni di topologia e routing può creare una dipendenza circolare in cui ogni switch è in pausa in attesa del successivo in un ciclo, e il traffico si arresta indefinitamente. OcNOS-DC integra un watchdog che rileva il ciclo in millisecondi e svuota automaticamente la coda interessata, prima che i job di training si blocchino.

Un ciclo di pause su 3 switch

Tre switch in una dipendenza circolare. Ciascuno è in pausa sulla propria coda prioritaria lossless, in attesa che lo switch successivo si svuoti. Senza intervento, il ciclo resta stabile all'infinito. Il watchdog di OcNOS scatta allo scadere del timeout configurato, svuota la queue-3 sullo switch-A e il ciclo si interrompe.

Ciclo di deadlock PFC e recovery tramite watchdog Tre switch disposti a triangolo. Le frecce di pausa puntano in senso orario da ogni switch al successivo, indicando che ciascuno switch è in pausa in attesa dello switch a valle. Un'icona watchdog sullo switch A mostra il timer di deadlock di OcNOS che scatta per svuotare la coda e interrompere il ciclo. Pausa PFC (CoS 3) Pausa PFC Pausa PFC WD il watchdog scatta svuota la coda 3 Switch-Ain pausa su Q3in attesa di B Switch-Bin pausa su Q3in attesa di C Switch-Cin pausa su Q3in attesa di A DEADLOCK PFC · TIMEOUT WATCHDOG · DRAIN DELLA CODA · AUTO-RECOVERY

Come PFC genera un deadlock

PFC è una pausa hop-by-hop: lo switch-A invia una pausa al proprio dispositivo upstream quando la sua coda di ingresso lossless si riempie oltre la soglia, e l'upstream interrompe l'invio. Questo funziona bene su una topologia ad albero, dove c'è un'unica direzione di flusso del traffico. Su un fabric leaf-spine con percorsi multipli, il rerouting ECMP attorno a un guasto di link può, in condizioni specifiche, creare un percorso circolare in cui ogni switch è in pausa in attesa del successivo.

Una volta formato, il ciclo è stabile: c'è memoria sufficiente per contenere i frame in pausa, il protocollo di routing ritiene che tutto sia a posto e PFC continua a riaffermarsi su ogni switch. Senza intervento, la priorità lossless interessata rimane bloccata indefinitamente. Il traffico RoCEv2 si arresta, i collettivi xCCL (NCCL / RCCL / oneCCL) vanno in timeout, il job di training si blocca.

Il watchdog OcNOS-DC

Detection

Timer per porta e per priorità

A timer runs per ingress port and per lossless priority. If the priority is paused continuously for the configured interval (typically 100-400 ms), the watchdog fires.

Recovery

Drain automatico delle code

All'attivazione, la coda di ingresso interessata viene drenata: alcuni frame vengono scartati temporaneamente per interrompere il ciclo. I frame scartati innescano ritrasmissioni dei collettivi xCCL, ma l'alternativa è un blocco a tempo indefinito.

Restoration

Ripristino automatico dopo il recovery

Trascorso l'intervallo di restore configurato, il normale funzionamento PFC riprende sulla priorità interessata. Nessun intervento dell'operatore richiesto; il fabric torna lossless nel giro di pochi secondi.

Telemetria

contatori gNMI

Gli eventi di attivazione del watchdog, le durate di drain e i contatori di pausa per priorità sono trasmessi via gNMI per un monitoraggio del fabric a ciclo chiuso. Gli SRE vedono gli eventi di deadlock come alert, non come stalli di training silenziosi.

Tunable

Timer configurabili dall'operatore

Il timeout di rilevamento, la durata di drain e l'intervallo di ripristino sono configurabili via CLI per porta e per priorità. I valori predefiniti funzionano per la maggior parte dei fabric; l'operatore può ridurre i timer sui cluster ad alto rischio.

Scope

Tier di licenza DC-PLUS

Parte della SKU OcNOS-DC PLUS insieme al resto dello stack RoCEv2 lossless. Confermato sulle piattaforme Broadcom Tomahawk 4 e Tomahawk 5.

Quando vedrà attivarsi questo meccanismo

In un fabric ben progettato con topologia e routing adeguati, i deadlock PFC sono rari. La maggior parte degli operatori non ne vede mai uno in anni di esercizio. Il watchdog conta perché "raro" non significa "mai": un guasto di collegamento durante una finestra di convergenza del routing, una configurazione errata delle priorità PFC su una singola porta o un evento di congestione transitorio su un profilo di traffico insolito possono tutti creare le condizioni. Senza il watchdog, quando questo scatta, il cluster AI si arresta e il team operativo ha davanti ore di debug. Con il watchdog, si ottiene solo una breve raffica di ritrasmissione e un evento registrato. Per progettare la topologia e i livelli di commutazione che mantengono rari gli stalli fin dall'inizio, utilizzare il Strumento di dimensionamento AI Fabric.

In sintesi

  • Rete di sicurezza lossless. Il watchdog è la differenza tra "il PFC è teoricamente rischioso sulle fabric AI di produzione" e "il PFC è sicuro da implementare su larga scala."
  • Recupero in meno di un secondo. Rilevazione, drain e ripristino si completano tipicamente in meno di un secondo. xCCL ritrasmette una piccola finestra di traffico RDMA e il job prosegue.
  • Configurazione standard. Il watchdog è attivo per impostazione predefinita nel template lossless di OcNOS-DC. Non deve ricordarsi di attivarlo.
  • Observable. Ogni evento viene registrato, conteggiato e trasmesso via gNMI. Monitoraggio closed-loop con il suo stack di observability esistente.
  • Regolabile in base alla posta in gioco. Abbassi i timer sui cluster di training critici; i valori predefiniti vanno bene per un fabric DC generico.

Sta validando il comportamento lossless su un nuovo fabric? Inizi dal watchdog.

Richiedi una Demo Tecnica →
FAQ

Domande frequenti

Che cosa provoca un deadlock PFC?
Il PFC è una pausa hop-by-hop. Su una fabric multipath, il rerouting ECMP che aggira un guasto di collegamento può, in determinate condizioni, creare un percorso circolare in cui ogni switch è in pausa in attesa del successivo. Il ciclo è stabile e la priorità lossless resta bloccata finché qualcosa non lo interrompe.
In che modo il watchdog PFC di OcNOS ripristina la fabric?
Un timer per porta e per priorità si attiva se una priorità lossless rimane in pausa per l'intervallo configurato (in genere da 100 a 400 ms). Il watchdog svuota la coda interessata interrompendo il ciclo, quindi ripristina il PFC normale dopo l'intervallo di ripristino, senza intervento dell'operatore.
Il watchdog scarta traffico?
Sì, per un breve istante. Lo svuotamento della coda scarta una piccola finestra di frame, il che innesca ritrasmissioni collettive xCCL. L'alternativa è un blocco indefinito, per cui il compromesso è un burst di ritrasmissione inferiore al secondo a fronte di un job di training fermo.
Il watchdog anti-deadlock PFC è abilitato per impostazione predefinita?
Sì. Il watchdog è attivo per impostazione predefinita nel template lossless di OcNOS-DC, con timer di rilevamento, svuotamento e ripristino regolabili da CLI. Fa parte della SKU OcNOS-DC PLUS sulle piattaforme Broadcom Tomahawk 4 e 5.