AI-Fabric-Design-Tool

Entwerfen Sie ein nicht-blockierendes RoCEv2-GPU-Fabric durchgängig und herstellerneutral. Dimensionieren Sie die Leaf- und Spine-Switches, planen Sie die Anzahl der Transceiver und Kabel, vergleichen Sie InfiniBand mit Ethernet für Ihr Cluster und erhalten Sie ein verlustfreies Congestion-Profil. Dieses Werkzeug entwirft ausschließlich das Netzwerk. Es liefert weder eine Kostenschätzung noch eine Stückliste.

Step 1

GPU-Fabric dimensionieren

Wählen Sie eine Ausgangsgröße oder geben Sie Ihre eigene GPU-Anzahl, Portgeschwindigkeit und Switch-Silicon an. Das Tool dimensioniert einen gefalteten zweistufigen Leaf-Spine-Pod und weist darauf hin, wenn ein Cluster in den dreistufigen Maßstab übergeht.

SPINE Spine 1Spine 2Spine 3 LEAF Leaf 1Leaf 2Leaf 3Leaf 4 GPU SERVERS
Leaf-Switches
Spine-Switches
Switches insgesamt

Diese Anzahlen setzen eine gefaltete Leaf-Spine-(Clos-)Fabric mit einer Fabric-NIC pro GPU voraus, wobei jedes Leaf seine Ports zwischen GPUs und Spine-Uplinks aufteilt. Rail-optimierte Verkabelung (mehrere NICs pro GPU) verändert die Verkehrslokalität, nicht diese Switch-Anzahlen. Siehe den AI-Fabric-Topologie-Referenzdesigns für die Rail-Optimized- und dreistufigen Layouts.

Step 2

Komponentenübersicht

Mengen für Fabric-Verbindungen, Transceiver und Kabel für das dimensionierte Design. Es handelt sich ausschließlich um Planungszahlen, nicht um eine Stückliste, ein Angebot oder eine Preisangabe.

ComponentBasisQuantity
GPU-seitige VerbindungenGPUs × 1 NIC
Fabric-Links von Leaf zu Spineleaves × uplinks
Fabric-Transceiverlinks × 2 ends
Fabric-Kabel1 pro Verbindung

Medium nach Reichweite, gewählt entsprechend Ihrer Verkabelung: bis 3 m DAC oder AEC, bis 50 bis 100 m AOC oder SR, bis 500 m DR (das Arbeitspferd), bis 2 km FR. Nur Reichweitenklassen. Keine Preise, SKUs oder Herstellerteilenummern. Fügen Sie bei einem dreistufigen Design zusätzlich zu den obigen Stückzahlen die Spine-zu-Super-Spine-Verbindungen hinzu.

Decision

InfiniBand vs. Ethernet

Eine anbieterneutrale Scorecard über sechs Faktoren hinweg. Sie zeigt, in welche Richtung jeder Faktor bei Ihren Eingaben tendiert und warum. Bewusst gibt es hier keinen einzelnen Sieger. Verwenden Sie sie als Eingabe für ein Design-Review, nicht als abschließende Empfehlung.

FactorInfiniBandEthernet / RoCEv2Ultra Ethernet (trajectory)
Spitzenleistungtendiert zu InfiniBandEin Roh-Durchsatzvorteil im mittleren Zehnprozentbereich bei geringem Tuning-Aufwand, ergänzt um die SHARP-In-Network-Reduction, die kollektive Operationen von den GPUs auslagert.Matches InfiniBand with proper tuning. Meta has described training its largest models on a 24,000-GPU RoCEv2 Ethernet cluster in production. The gap is tuning effort, not the ceiling.Ergänzt Packet Spray und NIC-seitiges Reordering, um die Tail-Latenz zu senken und die PFC-Abhängigkeit zu verringern, und verkleinert so den Out-of-Box-Abstand.
Costtendiert zu EthernetBringt in Fabric-Größenordnung einen erheblichen Aufpreis mit sich, der gegenüber vergleichbarem Ethernet üblicherweise mit 30 bis 60 Prozent angegeben wird.Merchant-Silicon-Switches und eine breite Optik-Lieferkette machen sie in der Regel zur Fabric mit geringeren Kosten pro Port.Dieselbe Ökonomie offener Merchant-Silicon wie bei Ethernet.
Offenheittendiert zu EthernetDurchgängiger Single-Vendor-Stack (Switches, NICs, Manager), sodass Multi-Vendor-Beschaffung eingeschränkt ist.Offen und Multi-Vendor: standardbasierte Switches, NICs und NOS von vielen Anbietern, was die Flexibilität der Lieferkette erhält.Ein Industriekonsortium-Standard (UEC 1.0, 2025), der die offene Ausrichtung stärkt.
Betriebliche EinfachheitneutralUFM stellt einen einzigen, speziell entwickelten Fabric-Manager bereit, der für Teams ohne tiefgehendes RDMA-Personal schlüsselfertig ist.Nutzt den großen Ethernet-Talentpool und Standardtooling, doch verlustfreies RoCEv2 erfordert eine sorgfältige End-to-End-Abstimmung.Zielt darauf ab, den Tuning-Aufwand zu verringern und Ethernet einem IB-ähnlichen Out-of-the-Box-Verhalten anzunähern.
Mandantenfähigkeit und Konvergenztendiert zu EthernetTypischerweise eine dedizierte Back-End-Insel, ohne native Multi-Tenant-Isolierung oder Storage-Konvergenz.Eine einzige konvergente Ethernet-Fabric kann Back-End-, Storage- und Front-End-Verkehr mit standardmäßiger Mandantenisolation übertragen.Erweitert die Converged-Ethernet-Ausrichtung auf einer einzigen offenen Fabric.
Trajectorytendiert zu EthernetAusgereift und stabil, mit führender Performance bei geringem Tuning, jedoch an die Roadmap eines einzigen Anbieters gebunden.Ethernet setzte sich bis Mitte 2025 an die Spitze der AI-Back-End-Bereitstellungen, getragen von einer breiten Ökosystem-Dynamik.UEC 1.0 (2025) ist eine Multi-Vendor-Spezifikation, die explizit auf AI- und HPC-Back-end-Fabrics abzielt.

Annahmen: Die Leistung wird mit Tuning verglichen (untuntes Ethernet fällt zurück, gut abgestimmtes Ethernet erreicht Parität); die Kosten werden als Spanne angegeben, nie als konkreter Geldbetrag; Offenheit bedeutet herstellerübergreifende Beschaffung, kein Qualitätsurteil; Ultra Ethernet spiegelt eine Ausrichtung ab 2025 wider, kein verfügbares Produkt. Das Tuning kollektiver Operationen bezieht sich generisch auf xCCL-Bibliotheken. Diese Angaben dienen der Entscheidungsfindung; validieren Sie die Wahl einer Fabric mit einem IP-Infusion-Ingenieur.

Profil

RoCEv2-Verlustfrei-Profil

RoCEv2 ist keine einzelne Switch-Funktion. Es handelt sich um ein Profil aus PFC, ECN und ETS, bei dem DCQCN die Arbeit im stationären Zustand übernimmt und PFC als Rückfallebene dient. Dieses Werkzeug empfiehlt die Mechanismen sowie die Reihenfolge, in der sie für Ihr Design angewendet werden sollten. Es gibt keine Schwellenwerte aus und greift auf kein Gerät zu.

MechanismRolle im verlustfreien ProfilOcNOS-Verfügbarkeit
PFCNo-Drop-Garantie für die RoCE-Klasse. Rückfallebene für den Notfall, nicht die primäre Steuerung.Alle 4 AI-Plattformen
ECNMarkiert Congestion frühzeitig, damit Sender ihre Rate drosseln, bevor Queues überlaufen. Stellen Sie den Markierungspunkt unterhalb des PFC-Triggers ein.Alle 4 AI-Plattformen
DCQCN (ECN + PFC)Primäre Steuerung im eingeschwungenen Zustand. Die ECN-Markierung steuert die DCQCN-Reaktion an den NICs; PFC sichert sie ab. Ein zusammengesetzter Mechanismus, keine eigenständige Funktion.Alle 4 AI-Plattformen
ETSBandbreitengarantien und Klassenisolierung, damit die verlustfreie Klasse nicht durch Best-Effort-Verkehr ausgehungert wird.Alle 4 AI-Plattformen
PFC-Deadlock-WatchdogErkennt und durchbricht PFC-Pause-Deadlocks oder Sturmzustände, das Sicherheitsnetz für das PFC-Backstop.Alle 4, OcNOS 7.0
DLB (dynamisches Load Balancing)Spreads elephant RoCE flows that collide under static ECMP, targeting utilization above 90 percent on the same switches.Alle 4 AI-Plattformen
Dynamisches ECNPasst die ECN-Markierung an die aktuellen Queue-Bedingungen an und reduziert das manuelle Nachjustieren bei Lastverschiebungen.nur TH5, OcNOS 7.0
DLB reaktiv / zufälligErweiterte DLB-Platzierungsmodi für eine engere Flow-Verteilung. Auf TH4 verwenden Sie Standard-DLB.nur TH5, OcNOS 7.0
GLB (Global Load Balancing)Fabric-weites Load Balancing über lokale DLB-Entscheidungen hinaus.Roadmap, OcNOS 7.1 Train
Ultra EthernetPacket Spray mit Reordering auf NIC-Seite und reduzierter PFC-Abhängigkeit, der Weg zu verlustfreiem AI-Ethernet.Roadmap, UEC-Profil

Nur zur Information. Diese Empfehlungen werden an kein Gerät ausgerollt, und hier werden keine Schwellenwerte erzeugt. Die Verfügbarkeit richtet sich nach OcNOS-DC Feature-Matrix und Hardware Compatibility List. Validieren Sie vor dem Deployment gegen die ausgewählten Plattformen und die OcNOS-Release.

Estimate

Fabric-Stromverbrauch

Ein typischer Leistungsbereich für die Fabric-Switches im dimensionierten Design. Nur Bereiche, mit bestückten Optiken. Netzwerk-Switches machen nur einen kleinen Teil der Gesamtleistung des Clusters aus; die GPUs dominieren.

kW typischer Tiefwert
kW unter Volllast

Kühlung: Rear-Door- oder Direct-Liquid-Kühlung wird typischerweise ab etwa 30 bis 40 kW pro Rack in Betracht gezogen, bedingt durch die Dichte der GPU-Server und nicht durch das Netzwerk. Dies ist eine Orientierung, keine berechnete thermische Last. Die Leistungsbereiche der Switches sind typische Werte für Geräte der Klasse 51,2T (Tomahawk 5) und 25,6T (Tomahawk 4) mit bestückter Optik; bestätigen Sie die genauen Werte anhand des jeweiligen Plattform-Datenblatts.

Passende OcNOS-DC-Plattformen

Die Fabric führt ein einziges OcNOS-DC-Image auf offener Broadcom-Tomahawk-Hardware aus. Dies sind die unterstützten 800G- und 400G-Plattformen, auf die sie ausgelegt wird.

Dieses Werkzeug liefert eine strukturelle Schätzung des Netzwerkdesigns ausschließlich zu Planungszwecken. Es ist weder eine Leistungsgarantie noch eine Stückliste noch eine Kostenschätzung. Tatsächliche Designs hängen von der Rail-Optimierung, der Anzahl der NICs pro GPU, der Verkabelung und den Entscheidungen zur Failure-Domain ab. Die GPU-Zahlen sind Obergrenzen des Referenzdesigns aus der Clos-Radix-Berechnung, keine gemessenen Werte. Broadcom und Tomahawk sind Marken der Broadcom Inc.; andere Namen sind Marken ihrer jeweiligen Inhaber.

Ressource

AI-Fabric-Referenzdesign

Erhalten Sie das Referenzdesign-PDF: Topologie, Switch-Anzahl, Komponentenübersicht und ein RoCEv2-Lossless-Startprofil.

PDF herunterladen
FAQ

Häufig gestellte Fragen

Wie dimensioniere ich eine Leaf-Spine-Fabric für ein GPU-Cluster?
In einer nicht blockierenden zweistufigen Leaf-Spine-Fabric widmet jeder Leaf-Switch die Hälfte seiner Ports den GPUs und die andere Hälfte den Spine-Uplinks. Die Anzahl der Leaf-Switches ergibt sich aus der GPU-Zahl geteilt durch die GPU-seitigen Ports pro Leaf, und die Anzahl der Spine-Switches ist die geringste, die erforderlich ist, um jeden Leaf-Uplink ohne Überbuchung zu tragen. Ein Cluster mit einem einzelnen Leaf benötigt keine Spine-Stufe. Dieses Tool berechnet diese Werte für Broadcom Tomahawk 4 und Tomahawk 5 bei 400G oder 800G.
Was ist eine rail-optimierte Topologie?
Rail-optimized bedeutet, dass jeder GPU-Server über mehrere NICs verfügt (in der Regel 8, eine je Rail) und jede Rail an ihrem eigenen Leaf angebunden ist; so landen GPUs mit gleichem Index über die Server hinweg auf demselben Leaf, und der dominierende AllReduce-Verkehr bleibt lokal. Es handelt sich um ein Verkabelungs- und Verkehrslokalitätsprinzip, das einer 1:1 nicht blockierenden Fabric überlagert wird. Es ändert, wo der Verkehr fließt, nicht die Anzahl der Leaf- und Spine-Switches.
Wie viele Transceiver benötigt eine AI-Fabric?
Jede Punkt-zu-Punkt-Fabric-Verbindung verwendet zwei Transceiver, einen an jedem Ende, sodass die Transceiver-Anzahl der Anzahl der Leaf-to-Spine-Verbindungen mal zwei entspricht. Die Anzahl der Verbindungen entspricht der Anzahl der Leaves multipliziert mit ihren Uplinks, was auch der Anzahl der Spines multipliziert mit ihren Downlinks entspricht. Dieses Tool weist diese Mengen aus. Es handelt sich ausschließlich um Planungszahlen, nicht um eine Stückliste oder ein Angebot.
Ist RoCEv2 oder InfiniBand besser für KI geeignet?
Keines von beiden ist grundsätzlich überlegen. InfiniBand überzeugt bei geringem Optimierungsaufwand durch hohe reine Leistung und bietet einen einzelnen Fabric-Manager. Ethernet mit RoCEv2 erreicht diese Leistung nach der Optimierung und liegt in der Regel bei Kosten, Offenheit, Mandantenfähigkeit und Branchenentwicklung vorn. Das passende Fabric hängt von der Cluster-Größe, der Personalausstattung und dem vorhandenen Stack ab. Dieses Werkzeug gewichtet die Faktoren anhand Ihrer Eingaben und übergibt die Entscheidung anschließend einem Design-Review.
Wie macht man eine AI Fabric für RoCEv2 verlustfrei?
Lossless RoCEv2 beruht auf drei zusammenwirkenden Mechanismen: PFC für eine verlustfreie Klasse, ECN für die frühzeitige Stausignalisierung und ETS für die Klassenisolation. DCQCN, also ECN in Kombination mit PFC, ist die primäre Steuerung im eingeschwungenen Zustand, während PFC als letzte Absicherung dient; daher sollte die ECN-Markierungsschwelle unterhalb der PFC-Schwelle eingestellt werden. Halten Sie PFC, ECN und CoS durchgängig konsistent. OcNOS-DC unterstützt diese Mechanismen auf den Tomahawk-AI-Plattformen.
Läuft dasselbe OcNOS-Image auf jedem Switch in der Fabric?
Ja. Jeder Leaf- und Spine-Switch führt ein einziges OcNOS-DC-Image mit RoCEv2, PFC und ECN sowie dynamischem Load Balancing auf offener Tomahawk-Hardware aus. Damit bleibt die Fabric unabhängig von der Anzahl der im Design erzeugten Switches auf einem Betriebssystem und einem Supportvertrag.
AI-Fabric

Die gesamte KI-Fabric mit OcNOS entwerfen

Vom Business Case bis zur Portanzahl-Berechnung: Steigen Sie dort ein, wo Sie beim Aufbau gerade stehen.