Adaptives Routing · Flowlet · RoCEv2

Dynamic Load Balancing: Adaptive Routing für AI-Fabrics

Verwenden Sie in einer AI-Fabric adaptives Dynamic Load Balancing statt statischem Hash-ECMP. DLB bewertet den Pfad bei jedem Flowlet neu, einem Sub-Flow-Abschnitt, der durch eine Inter-Packet-Gap abgegrenzt ist, unter Verwendung von Live-ASIC-Telemetrie zu Egress-Queue-Tiefe und Port-Auslastung, sodass GPU-Kollektive nicht länger auf einem einzelnen Uplink kollidieren. Es läuft im Switch-ASIC auf Broadcom Tomahawk 4 und 5, ohne Änderungen an NIC oder Collective-Library.

Pro Flowletadaptive Pfadauswahl
TH4 + TH5Broadcom Tomahawk 25.6T / 51.2T
0 NIC-Änderungenläuft im Switch-ASIC
PLUSOcNOS-DC-Lizenzstufe
Adaptive Routing in Aktion

Adaptive Routing auf einer Leaf-Spine-Fabric

Ein Ausschnitt mit vier Spines und zwei Leaves, der GPU-AllReduce-Verkehr trägt. DLB misst die lokale Egress-Queue-Tiefe in Echtzeit. Wenn Spine-3 sättigt, verlagert das Leaf das nächste Flowlet auf ein weniger ausgelastetes Spine und hält alle vier Uplinks im Gleichgewicht.

Dynamic Load Balancing über eine AI-Leaf-Spine-Fabric Eine AI-Fabric mit vier Spines und zwei Leaves. An die Leaves angeschlossene GPU-Server senden AllReduce-Flows. Drei Spine-Pfade transportieren gleichmäßig verteilte Flowlets. Der vierte Spine ist überlastet, und Dynamic Load Balancing verlagert das nächste Flowlet auf einen weniger ausgelasteten Spine. Das untere Band zeigt DLB-Metriken: Queue-Tiefe, Portauslastung, Flowlet-Neuzuordnung. Spine-3 überlastet · nächstes Flowlet auf Spine-2 neu zugeordnet Spine-1 Queue 18 % Spine-2 Queue 22 % Spine-3 Queue 92 % Spine-4 Queue 25 % Leaf-1 DLB · Flowlet Leaf-2 DLB · Flowlet GPU-0 GPU-1 GPU-2 GPU-3 DLB · QUEUE-TIEFEN-FEEDBACK · FLOWLET-NEUZUORDNUNG · ÜBERLASTBEWUSSTES ECMP
Warum statisches ECMP auf AI-Fabrics scheitert

Statisches ECMP und DLB, Achse für Achse

Standard-ECMP hasht das 5-Tupel beim Flow-Start und fixiert den Flow für seine gesamte Lebensdauer. Bei Nord-Süd-Webverkehr glätten Millionen kurzlebiger Flows die Auslastung über die Pfade. In einer AI-Fabric verursachen eine Handvoll GPU-Elephant-Flows, von denen jeder einen ganzen 400G- oder 800G-Uplink für Sekunden belegt, Hash-Kollisionen: Einige Uplinks sättigen, während parallele Pfade brachliegen. DLB bewertet den Pfad bei jedem Flowlet mithilfe von Live-ASIC-Telemetrie neu.

Kriterium Statisches ECMPhashen und fixieren DLBadaptiv, pro Flowlet
PfadentscheidungHasht das 5-Tupel einmal beim Flow-Start und fixiert den Flow für seine gesamte Lebensdauer.Bewertet den Pfad an jeder Flowlet-Grenze neu und verlagert Verkehr auf einen weniger überlasteten Uplink.
GranularitätGanzer Flow. Eine einzige Hash-Entscheidung bestimmt Sekunden von Elephant-Flow-Verkehr.Flowlet: ein Sub-Flow-Abschnitt, abgegrenzt durch eine kleine Inter-Packet-Gap, sicher neu verteilbar ohne Neuordnung.
Congestion-SignalKeines. Der Hash ist blind für den Echtzeit-Link-Status.Live-ASIC-Telemetrie zu Egress-Queue-Tiefe und Port-Auslastung, alle paar Mikrosekunden neu berechnet.
Unter GPU-Elephant-FlowsHash-Kollisionen: Zwei Elefanten können auf demselben Uplink landen, während ein anderer brachliegt.Gesättigte Members fallen innerhalb eines Flowlets aus der Kandidatenmenge, sodass die Uplinks im Gleichgewicht bleiben.
NeuordnungsrisikoKeines; der Flow ist fixiert, aber auf Kosten von Hotspots und Tail-Latenz-Ausreißern.In der Praxis keines; die Inter-Packet-Gap sorgt dafür, dass RoCEv2 und TCP eine korrekte In-Order-Zustellung sehen.
NIC / Collective-LibraryKeine Änderungen; Standardverhalten.Keine Änderungen. Läuft im Switch-ASIC, sodass RoCEv2-NICs und xCCL-Stacks unberührt bleiben.
HardwareJeder ECMP-fähige Switch.Broadcom Tomahawk 4 (25.6T) und Tomahawk 5 (51.2T) in 64x400G- und 64x800G-Konfigurationen.
TelemetrieStandard-Interface-Zähler.Per-Member-Rebind-Zähler, Flowlet-Gap-Verteilungen und Member-Quality-Scores über gNMI.
Ein Blick in die Implementierung

Die OcNOS-DLB-Implementierung

DLB ist kein Aufsatz auf der Control-Plane. Es läuft in der Broadcom-Forwarding-Pipeline, bewertet jeden ECMP-Next-Hop anhand von Live-Congestion-Signalen und verteilt Flowlets in Hardware neu, gemeinsam abgestimmt mit dem verlustfreien RoCEv2-Stack.

Flowlet-Erkennung

Gap-Timer im Sub-Millisekunden-Bereich

Ein ASIC-nativer Flowlet-Inaktivitäts-Timer (typisch 16 bis 256 µs) teilt lange Elephant-Flows in Abschnitte, die sich sicher über Pfade verteilen lassen, ohne TCP- oder RoCEv2-Neuordnung.

Pfadqualität

Live-Feedback zur Queue-Tiefe

DLB nutzt Signale zur Queue-Belegung pro Egress-Port und zur Link-Auslastung aus der Tomahawk-Pipeline, um jeden ECMP-Next-Hop in Echtzeit zu bewerten.

Neuzuordnung

Adaptive Next-Hop-Auswahl

An jeder Flowlet-Grenze wird der Member mit der höchsten Qualität ausgewählt. Die Member-Qualität wird alle paar Mikrosekunden neu berechnet, sodass ein gesättigtes Spine innerhalb eines Flowlets aus der Kandidatenmenge fällt.

Verlustfrei

Abgestimmt mit PFC & ECN

DLB ist in den verlustfreien RoCEv2-Stack integriert (PFC, ECN/DCQCN, Headroom-Berechnung), sodass das Flowlet-Rebinding erfolgt, bevor sich Pause-Frames upstream ausbreiten.

Telemetrie

gNMI-Export

Pro-Member-Rebind-Zähler, Flowlet-Gap-Verteilungen und Member-Quality-Scores werden über gNMI Dial-out gestreamt für eine Closed-Loop-Fabric-Abstimmung.

Hardware

TH4 / TH5 nativ

Validiert auf Broadcom Tomahawk 4 (25.6T) und Tomahawk 5 (51.2T) Spine-Plattformen, in 64x400G- und 64x800G-Port-Konfigurationen, ohne Software-Fast-Path-Einbußen.

Teil des Adaptive-Routing-Stacks

Wo DLB in der Fabric sitzt

DLB ist die Single-Hop-, congestion-bewusste Schicht eines größeren offenen Ethernet-Transports. Es setzt auf verlustfreiem RoCEv2 auf und übergibt an fabric-weites GLB für Ende-zu-Ende-Bewertung.

Verlustfreier Transport darunter

DLB verteilt Flowlets neu auf Basis einer Verlustfreie RoCEv2-Fabric , (PFC, ECN, DCQCN), sodass Adaptive Routing und verlustfreies RDMA gemeinsam abgestimmt werden, anstatt gegeneinander zu arbeiten.

Fabric-weite Bewertung als Nächstes

Wo DLB den lokalen Next-Hop bewertet, GLB (OcNOS 7.1) erweitert die Entscheidung auf die Ende-zu-Ende-Pfadqualität über die gesamte Leaf-Spine-Fabric.

Dieselbe Idee in der NIC

Ultra Ethernet verlagert die Pfadverteilung in die NIC: Packet Spray und Multi-Path-RDMA verteilen einen Flow von UEC-fähigen NICs aus über viele Pfade.

In der Produktion

Was DLB in produktiven AI-Fabrics leistet

Indem DLB Flowlets von den überlasteten Uplinks fernhält, die statisches ECMP überfrachtet, macht es aus einer symmetrischen Leaf-Spine-Fabric eine, die unter GPU-Kollektivverkehr ausbalanciert bleibt.

  • Höhere Auslastung. Flowlet-Rebalancing hält Traffic von den überlasteten Uplinks fern, die statisches ECMP überfrachtet, sodass eine gut betriebene Fabric auf derselben Hardware eine Auslastung von über 90 Prozent anstreben kann, ohne zusätzliche Uplinks zu kaufen.
  • Niedrigere Tail-Latenz. Die P99.9-Collective-Completion-Time verbessert sich, weil kein einzelner Link gesättigt wird, während andere ungenutzt bleiben.
  • Schnelleres Training. Weniger GPU-Idle-Zeit beim Warten auf den langsamsten Rank bedeutet eine messbare Verbesserung der Wall-Clock-Zeit bei AllReduce-lastigen Workloads.
  • Keine NIC-Änderungen. DLB ist im Switch-ASIC angesiedelt. Bestehende RoCEv2-NICs und xCCL-Kollektiv-Stacks (NCCL, RCCL, oneCCL) sehen eine korrekte In-Order-Zustellung ohne Codeänderungen.
  • PLUS-Stufe. DLB ist in den OcNOS-DC-PLUS-SKUs enthalten, mit demselben Image und demselben Supportvertrag wie das übrige OcNOS-DC.
Die Sichtweise von IP Infusion

Adaptives Routing ist Grundvoraussetzung für eine Ethernet-AI-Fabric

Statisches ECMP wurde für Nord-Süd-Webverkehr entwickelt. Sobald eine Fabric GPU-Kollektive überträgt, entscheidet adaptives Routing über den Unterschied zwischen ausbalancierten Uplinks und ins Stocken geratenen Trainingsjobs, und OcNOS liefert es heute auf offener Hardware.

ECMP allein reicht nicht aus

Eine Handvoll Elephant-Flows setzt statisches Hashing außer Kraft. Hash-Kollisionen lassen einige Uplinks gesättigt zurück, während parallele Pfade ungenutzt bleiben.

DLB schließt die Routing-Lücke

Überlastungsbewusste Pfadauswahl je Flowlet hält eine Ethernet-Fabric unter Kollektivverkehr ausbalanciert, eine der Dimensionen, in denen InfiniBand einen Vorsprung hatte.

OcNOS ist der Enabler

DLB heute, GLB in OcNOS 7.1. Ein NOS auf validierter offener Hardware von Anbietern wie Edgecore und UfiSpace, ohne Änderungen an NIC oder Kollektivbibliothek.

Dynamic Load Balancing, erklärt

Was ist ein Flowlet und warum verwendet DLB es?
Ein Flowlet ist ein Teilfluss-Abschnitt, der durch eine kleine Lücke zwischen Paketen abgegrenzt wird. DLB bewertet den Pfad an jeder Flowlet-Grenze neu, anstatt einen gesamten Fluss festzulegen, sodass der Verkehr auf einen weniger ausgelasteten Uplink wechselt, ohne eine RoCEv2- oder TCP-Umsortierung auszulösen.
Worin unterscheidet sich DLB von statischem ECMP?
Statisches ECMP hasht das 5-Tupel beim Flow-Start und fixiert den Flow für seine gesamte Lebensdauer, sodass zwei GPU-Elephant-Flows auf einem Uplink kollidieren können, während ein anderer ungenutzt bleibt. DLB bewertet jeden Next-Hop in Echtzeit anhand aktueller Queue-Tiefe und Port-Auslastung und bindet Flowlets an den besten Pfad um.
Erfordert DLB neue NICs oder Änderungen an meiner Collective-Bibliothek?
Nein. DLB läuft im Switch-ASIC, sodass vorhandene RoCEv2-NICs und xCCL-Collective-Stacks (NCCL, RCCL, oneCCL) eine korrekte In-Order-Zustellung ohne Codeänderungen erhalten.
Welche Hardware unterstützt OcNOS DLB?
DLB wird auf Broadcom-Tomahawk-4- (25,6T) und Tomahawk-5-Plattformen (51,2T) in 64x400G- und 64x800G-Konfigurationen unterstützt. Es ist in den OcNOS-DC-PLUS-SKUs enthalten, nicht in IPBASE.

DLB für Ihre GPU-Fabric optimieren? Fordern Sie eine workload-spezifische Bewertung an

Nennen Sie uns die GPU-Größenordnung und das Kollektivmuster, und ein IP Infusion Engineer stimmt gemeinsam mit Ihnen die Flowlet-Timer und das Path-Scoring ab, oder beginnen Sie mit einem ersten Leaf-Spine-Entwurf in der AI Fabric Design Suite.