PFC-Watchdog · RoCEv2 · Verlustfrei

PFC-Deadlock-Erkennung & -Behebung

Ein PFC-Deadlock ist der eine Fehler, der eine verlustfreie Fabric unbegrenzt blockieren kann: eine zyklische Pufferabhängigkeit, bei der pausierte Prioritäts-Queues aufeinander warten. Der OcNOS-DC-Watchdog arbeitet pro Port und pro Priorität. Er erkennt den Zyklus pausierter Queues und leert die Queue automatisch, bevor Jobs blockieren, auf Broadcom Tomahawk 4 und Tomahawk 5.

Per-portund Per-Priorität-Watchdog
Sub-seconderkennen, leeren, wiederherstellen
TH4 & TH5Broadcom Tomahawk-Plattformen
Standardmäßig aktiviertOcNOS-DC-Verlustfrei-Template
Wie ein Deadlock aussieht

Ein Pausenzyklus mit 3 Switches

Drei Switches in einer zirkulären Abhängigkeit. Jeder ist an seiner verlustfreien Prioritäts-Queue pausiert und wartet darauf, dass der nächste Switch leert. Ohne Eingriff ist der Zyklus für immer stabil. Der OcNOS-Watchdog löst nach dem konfigurierten Timeout aus, leert Queue 3 auf Switch-A, und der Zyklus bricht zusammen.

PFC-Deadlock-Zyklus und Watchdog-Recovery Three switches arranged in a triangle. Pause arrows point clockwise from each switch to the next, indicating each switch is paused waiting for the downstream switch. A watchdog icon at Switch-A shows the OcNOS deadlock timer firing to drain the queue and break the cycle. PFC-Pause (CoS 3) PFC-Pause PFC-Pause WD Watchdog löst aus Queue 3 leeren Switch-Apausiert auf Q3wartet auf B Switch-Bpausiert auf Q3wartet auf C Switch-Cpausiert auf Q3wartet auf A PFC DEADLOCK · WATCHDOG TIMEOUT · QUEUE DRAIN · AUTO-RECOVERY
Wie er entsteht

Wie PFC einen Deadlock erzeugt

PFC macht RoCEv2 verlustfrei und verursacht auf einer wohlgeformten Topologie nie Probleme. Der Fehlerfall tritt nur auf, wenn sich auf einer Multi-Path-Fabric ein Zyklus pausierter Queues schließt.

PFC ist eine Hop-für-Hop-Pause: Ein Switch signalisiert seinem Upstream eine Pause, wenn seine verlustfreie Ingress-Queue über den Schwellenwert hinaus gefüllt ist, und der Upstream stellt das Senden ein. Auf einer Baumtopologie mit einer einzigen Flussrichtung ist das sicher. Auf einer Leaf-Spine-Fabric mit mehreren Pfaden kann ECMP-Rerouting um einen Link-Ausfall herum unter bestimmten Bedingungen einen zirkulären Pfad erzeugen, auf dem jeder Switch pausiert und auf den nächsten wartet. Diese zyklische Pufferabhängigkeit, pausierte Prioritäts-Queues, die aufeinander warten, ist ein PFC-Deadlock.

Sobald der Zyklus entsteht, ist er stabil: Es gibt genügend Puffer, um die pausierten Frames zu halten, das Routing-Protokoll geht davon aus, dass alles konvergiert ist, und PFC signalisiert auf jedem Switch weiterhin die Pause. Ohne Eingriff bleibt die betroffene verlustfreie Priorität unbegrenzt blockiert. Der RoCEv2-Traffic stoppt, xCCL-Kollektive (RCCL, oneCCL) laufen in ein Timeout, und der Trainingsjob gerät ins Stocken.

Der Mechanismus

Der OcNOS-DC-Watchdog

Ein Timer pro Port und pro Priorität, der den Zyklus pausierter Queues erkennt und die betroffene Queue leert, bevor Jobs blockieren, und dann von selbst den normalen PFC-Betrieb wiederherstellt. Erkennung, Behebung und Wiederherstellung bilden das Kern-Trio; Telemetrie, Tuning und Lizenzierung runden es ab.

Detection

Timer pro Port, pro Priorität

Ein Timer läuft pro Ingress-Port und pro verlustfreier Priorität. Wenn die Priorität durchgehend für das konfigurierte Intervall (typischerweise 100 bis 400 ms) pausiert ist, löst der Watchdog aus.

Recovery

Automatisches Queue-Draining

Bei Auslösung wird die betroffene Ingress-Queue geleert: Frames werden vorübergehend verworfen, damit der Zyklus zusammenbricht. Die verworfenen Frames lösen Retransmits der xCCL-Kollektive aus, doch die Alternative wäre ein unbegrenzter Hang.

Restoration

Automatische Wiederherstellung nach Recovery

Nach dem konfigurierten Restore-Intervall wird der normale PFC-Betrieb auf der betroffenen Priority wieder aufgenommen. Kein Eingreifen durch den Operator erforderlich: Das Fabric ist innerhalb von Sekunden wieder lossless.

Telemetrie

gNMI-Zähler

Watchdog-Auslöseereignisse, Drain-Dauern und Pause-Zähler pro Priorität werden über gNMI für Closed-Loop-Fabric-Monitoring gestreamt. SREs sehen Deadlock-Ereignisse als Alarme, nicht als stille Trainings-Stalls.

Tunable

Vom Betreiber konfigurierbare Timer

Detektions-Timeout, Drain-Dauer und Restore-Intervall sind per CLI pro Port und pro Priorität konfigurierbar. Die Standardwerte funktionieren für die meisten Fabrics; der Betreiber kann die Timer auf kritischen Clustern verkürzen.

Einsatzbereich

DC-PLUS-Lizenzstufe

Teil der OcNOS-DC PLUS SKU neben dem restlichen verlustfreien RoCEv2-Stack. Bestätigt auf Broadcom Tomahawk 4- und Tomahawk 5-Plattformen.

Der umgebende Stack

Der Watchdog ist ein Sicherheitsnetz unter dem übrigen verlustfreien Stack

Der beste Deadlock ist der, der nie entsteht. Congestion Control, der verlustfreie Transport, den sie schützt, und adaptives Routing halten Queues von vornherein unterhalb des Pausen-Schwellenwerts; der Watchdog ist die letzte Instanz, wenn sie es nicht tun.

Überlastungssteuerung

DCQCN markiert und drosselt Flows mit ECN, bevor Ingress-Queues den PFC-Schwellenwert erreichen, sodass Pausen weitaus seltener signalisiert werden und Zyklen selten die Chance erhalten, sich zu schließen.

Verlustfreier Transport

RoCEv2 ist der RDMA-Transport, zu dessen Schutz PFC existiert. Der Watchdog macht den verlustfreien RoCEv2-Betrieb im großen Maßstab sicher, statt theoretisch riskant.

Adaptives Routing

DLB bindet Flowlets in Sub-Millisekunden-Fenstern von überlasteten Uplinks weg und verteilt die Last, sodass Ingress-Queues seltener den Schwellenwert erreichen, der eine Pause auslöst.

Wann dies auslöst

Selten bedeutet nicht nie, und genau darum geht es

In einer gut konzipierten Fabric mit passender Topologie und passendem Routing sind PFC-Deadlocks selten, und die meisten Betreiber erleben über Jahre des Betriebs keinen einzigen. Der Watchdog ist wichtig, weil die Bedingungen dennoch eintreten können, und wenn sie es tun, wird der Unterschied in Stunden gemessen.

Was ihn auslöst

Ein Link-Ausfall während eines Routing-Konvergenzfensters, eine Fehlkonfiguration der PFC-Prioritäten an einem einzelnen Port oder ein vorübergehendes Überlastungsereignis bei einem ungewöhnlichen Verkehrsmuster können jeweils die Bedingungen schaffen.

Ohne den Watchdog

Wenn ein Deadlock entsteht, stoppt der KI-Cluster, und das Betriebsteam hat Stunden der Fehlersuche vor sich, auf der Jagd nach einer Blockade, die das Routing-Protokoll als fehlerfrei meldet.

Mit dem Watchdog

Sie erhalten einen kurzen Retransmission-Burst und ein protokolliertes Ereignis statt eines blockierten Jobs. Legen Sie die Topologie und die Switch-Ebenen, die Deadlocks selten halten, mit dem AI Fabric Sizing Tool aus.

Das Fazit

Warum der Watchdog PFC für den Einsatz im großen Maßstab sicher macht

Er verwandelt den einen theoretischen Einwand gegen verlustfreies Ethernet in ein protokolliertes, sich selbst auflösendes Ereignis, das Ihr bestehender Observability-Stack bereits sieht.

  • Verlustfreies Sicherheitsnetz. Der Watchdog ist der Unterschied zwischen "PFC ist auf produktiven AI-Fabrics theoretisch riskant" und "PFC lässt sich sicher im großen Maßstab betreiben".
  • Wiederherstellung im Subsekundenbereich. Erkennung, Leeren und Wiederherstellung sind typischerweise innerhalb einer Sekunde abgeschlossen. xCCL überträgt ein kleines Fenster an RDMA-Traffic erneut; der Job läuft weiter.
  • Standardkonfiguration. Der Watchdog ist im OcNOS-DC-Verlustfrei-Template standardmäßig aktiviert. Sie müssen nicht daran denken, ihn einzuschalten.
  • Observable. Jedes Auslösen wird protokolliert, gezählt und über gNMI gestreamt, für ein Closed-Loop-Monitoring mit Ihrem bestehenden Observability-Stack.
  • Abstimmbar je nach Anforderung. Senken Sie die Timer auf kritischen Trainingsclustern; die Standardwerte sind für allgemeine DC-Fabrics ausreichend. Siehe PFC in der Feature-Matrix and the Liste validierter Hardware.
FAQ

PFC-Deadlock, erklärt

Wodurch entsteht ein PFC-Deadlock?
PFC ist eine Hop-für-Hop-Pause. Auf einer Multi-Path-Fabric kann ECMP-Rerouting um einen Link-Ausfall herum unter bestimmten Bedingungen einen zirkulären Pfad erzeugen, auf dem jeder Switch pausiert und auf den nächsten wartet. Die zyklische Pufferabhängigkeit ist stabil, und die verlustfreie Priorität bleibt blockiert, bis etwas sie auflöst.
Wie stellt der PFC-Watchdog von OcNOS die Fabric wieder her?
Ein Timer je Port und je Priorität wird ausgelöst, wenn eine verlustfreie Priorität für das konfigurierte Intervall (typischerweise 100 bis 400 ms) pausiert bleibt. Der Watchdog entleert die betroffene Queue, sodass der Zyklus zusammenbricht, und stellt anschließend nach dem Wiederherstellungsintervall den normalen PFC wieder her, ohne Eingriff des Netzbetreibers.
Verwirft der Watchdog Datenverkehr?
Ja, kurzzeitig. Das Entleeren der Queue verwirft ein kleines Fenster von Frames, was kollektive xCCL-Retransmits auslöst. Die Alternative wäre ein unbestimmter Hang, sodass der Kompromiss aus einem Retransmit-Burst von unter einer Sekunde gegenüber einem stillstehenden Trainingsjob besteht.
Ist der PFC-Deadlock-Watchdog standardmäßig aktiviert?
Ja. Der Watchdog ist im OcNOS-DC-Verlustfrei-Template standardmäßig aktiviert, mit über die CLI einstellbaren Timern für Erkennung, Leeren und Wiederherstellung. Er ist Teil des OcNOS-DC PLUS SKU auf Broadcom Tomahawk 4- und Tomahawk 5-Plattformen.

Sie validieren das verlustfreie Verhalten einer neuen Fabric? Beginnen Sie mit dem Watchdog

Nennen Sie uns den Workload und die GPU-Größenordnung, und ein IP Infusion Engineer prüft gemeinsam mit Ihnen Ihr verlustfreies Design, oder beginnen Sie mit einem ersten Leaf-Spine-Entwurf in der AI Fabric Design Suite.