PFC Deadlock Detection & Recovery

PFC-Pause macht RoCEv2 verlustfrei, doch unter seltenen Topologie- und Routing-Bedingungen kann eine zirkuläre Abhängigkeit entstehen, bei der jeder Switch pausiert und auf den nächsten in einem Zyklus wartet, sodass der Verkehr auf unbestimmte Zeit zum Stillstand kommt. OcNOS-DC liefert einen Watchdog, der den Zyklus innerhalb von Millisekunden erkennt und die betroffene Queue automatisch leert, bevor Trainingsjobs hängen bleiben.

Ein 3-Switch-Pause-Cycle

Drei Switches in einer zirkulären Abhängigkeit. Jeder ist auf seiner verlustfreien Priority-Queue pausiert und wartet darauf, dass der nächste Switch leerläuft. Ohne Eingriff bleibt der Zyklus für immer stabil. Der OcNOS-Watchdog löst nach dem konfigurierten Timeout aus, leert Queue-3 auf Switch-A, und der Zyklus bricht zusammen.

PFC-Deadlock-Zyklus und Watchdog-Recovery Drei in einem Dreieck angeordnete Switches. Pause-Pfeile zeigen im Uhrzeigersinn von jedem Switch zum nächsten und signalisieren, dass jeder Switch pausiert ist und auf den nachgelagerten Switch wartet. Ein Watchdog-Icon an Switch A zeigt den OcNOS-Deadlock-Timer, der auslöst, um die Queue zu leeren und den Zyklus zu durchbrechen. PFC-Pause (CoS 3) PFC-Pause PFC-Pause WD Watchdog löst aus Queue 3 leeren Switch-Apausiert auf Q3wartet auf B Switch-Bpausiert auf Q3wartet auf C Switch-Cpausiert auf Q3wartet auf A PFC DEADLOCK · WATCHDOG-TIMEOUT · QUEUE DRAIN · AUTO-RECOVERY

Wie PFC einen Deadlock erzeugt

PFC ist ein Hop-by-Hop-Pause-Mechanismus: Switch A signalisiert seinem Upstream eine Pause, wenn seine verlustfreie Ingress-Queue über den Schwellenwert hinaus gefüllt ist, und der Upstream stellt das Senden ein. In einer Baumtopologie mit einer einzigen Verkehrsflussrichtung funktioniert dies einwandfrei. In einer Leaf-Spine-Fabric mit mehreren Pfaden kann das ECMP-Rerouting um einen Link-Ausfall herum unter bestimmten Bedingungen einen zirkulären Pfad erzeugen, in dem jeder Switch pausiert und auf den nächsten wartet.

Sobald sich der Zyklus gebildet hat, ist er stabil: Es ist genügend Speicher vorhanden, um die pausierten Frames zu halten, das Routing-Protokoll geht davon aus, dass alles in Ordnung ist, und PFC setzt sich auf jedem Switch immer wieder neu durch. Ohne Eingreifen bleibt die betroffene Lossless-Priority unbegrenzt blockiert. Der RoCEv2-Traffic kommt zum Erliegen, xCCL-Kollektive (NCCL / RCCL / oneCCL) laufen in Timeout, der Trainingsjob bleibt hängen.

Der OcNOS-DC-Watchdog

Detection

Timer pro Port, pro Priorität

A timer runs per ingress port and per lossless priority. If the priority is paused continuously for the configured interval (typically 100-400 ms), the watchdog fires.

Recovery

Automatisches Queue-Draining

Bei Auslösung wird die betroffene Ingress-Queue geleert: Frames werden vorübergehend verworfen, damit der Zyklus zusammenbricht. Die verworfenen Frames lösen Retransmits der xCCL-Kollektive aus, doch die Alternative wäre ein unbegrenzter Hang.

Restoration

Automatische Wiederherstellung nach Recovery

Nach dem konfigurierten Restore-Intervall wird der normale PFC-Betrieb auf der betroffenen Priority wieder aufgenommen. Kein Eingreifen durch den Operator erforderlich: Das Fabric ist innerhalb von Sekunden wieder lossless.

Telemetrie

gNMI-Zähler

Watchdog-Auslöseereignisse, Drain-Dauern und Pause-Zähler pro Priorität werden über gNMI für Closed-Loop-Fabric-Monitoring gestreamt. SREs sehen Deadlock-Ereignisse als Alarme, nicht als stille Trainings-Stalls.

Tunable

Vom Betreiber konfigurierbare Timer

Detektions-Timeout, Drain-Dauer und Restore-Intervall sind per CLI pro Port und pro Priorität konfigurierbar. Die Standardwerte funktionieren für die meisten Fabrics; der Betreiber kann die Timer auf kritischen Clustern verkürzen.

Scope

DC-PLUS-Lizenzstufe

Teil der OcNOS-DC PLUS SKU neben dem restlichen verlustfreien RoCEv2-Stack. Bestätigt auf Broadcom Tomahawk 4- und Tomahawk 5-Plattformen.

Wann Sie dies ausgelöst sehen

In einem gut konzipierten Fabric mit ordentlicher Topologie und ordentlichem Routing sind PFC-Deadlocks selten. Die meisten Betreiber sehen über Jahre im Betrieb nie einen. Der Watchdog ist wichtig, weil "selten" bedeutet nicht "nie": Ein Verbindungsausfall während eines Routing-Konvergenzfensters, eine Fehlkonfiguration der PFC-Prioritäten an einem einzelnen Port oder ein vorübergehendes Congestion-Ereignis bei einem ungewöhnlichen Verkehrsmuster können allesamt die Bedingungen schaffen. Ohne den Watchdog stoppt das AI-Cluster, wenn er auslöst, und dem Betriebsteam stehen Stunden der Fehlersuche bevor. Mit dem Watchdog erhalten Sie lediglich einen kurzen Retransmission-Burst und ein protokolliertes Ereignis. Um die Topologie und die Switch-Ebenen zu planen, die Deadlocks von vornherein selten halten, nutzen Sie den AI-Fabric-Dimensionierungstool.

Das Fazit

  • Verlustfreies Sicherheitsnetz. Der Watchdog ist der Unterschied zwischen "PFC ist auf produktiven AI-Fabrics theoretisch riskant" und "PFC lässt sich sicher im großen Maßstab betreiben".
  • Wiederherstellung im Subsekundenbereich. Detection, Drain und Restore sind typischerweise in unter einer Sekunde abgeschlossen. xCCL überträgt ein kleines RDMA-Traffic-Fenster erneut; der Job läuft weiter.
  • Standardkonfiguration. Der Watchdog ist im Lossless-Template von OcNOS-DC standardmäßig aktiviert. Sie müssen nicht daran denken, ihn einzuschalten.
  • Observable. Jeder Vorfall wird protokolliert, gezählt und per gNMI gestreamt. Closed-Loop-Monitoring mit Ihrem bestehenden Observability-Stack.
  • Abstimmbar je nach Anforderung. Senken Sie die Timer bei kritischen Trainings-Clustern; die Standardwerte sind für allgemeine DC-Fabrics ausreichend.

Validieren Sie verlustfreies Verhalten auf einer neuen Fabric? Beginnen Sie mit dem Watchdog.

Technische Demo anfragen →
FAQ

Häufig gestellte Fragen

Wodurch entsteht ein PFC-Deadlock?
PFC ist eine Hop-by-Hop-Pause. In einer Multipath-Fabric kann das ECMP-Rerouting um einen Link-Ausfall unter bestimmten Bedingungen einen zirkulären Pfad erzeugen, in dem jeder Switch pausiert und auf den nächsten wartet. Der Zyklus ist stabil, und die Lossless-Priorität bleibt blockiert, bis etwas ihn auflöst.
Wie stellt der PFC-Watchdog von OcNOS die Fabric wieder her?
Ein Timer je Port und je Priorität wird ausgelöst, wenn eine verlustfreie Priorität für das konfigurierte Intervall (typischerweise 100 bis 400 ms) pausiert bleibt. Der Watchdog entleert die betroffene Queue, sodass der Zyklus zusammenbricht, und stellt anschließend nach dem Wiederherstellungsintervall den normalen PFC wieder her, ohne Eingriff des Netzbetreibers.
Verwirft der Watchdog Datenverkehr?
Ja, kurzzeitig. Das Entleeren der Queue verwirft ein kleines Fenster von Frames, was kollektive xCCL-Retransmits auslöst. Die Alternative wäre ein unbestimmter Hang, sodass der Kompromiss aus einem Retransmit-Burst von unter einer Sekunde gegenüber einem stillstehenden Trainingsjob besteht.
Ist der PFC-Deadlock-Watchdog standardmäßig aktiviert?
Ja. Der Watchdog ist im Lossless-Template von OcNOS-DC standardmäßig aktiviert, mit über die CLI einstellbaren Timern für Erkennung, Drain und Wiederherstellung. Er ist Bestandteil der OcNOS-DC PLUS SKU auf den Broadcom Tomahawk 4 und 5 Plattformen.