AI-Fabric-Design-Tool
Entwerfen Sie ein nicht-blockierendes RoCEv2-GPU-Fabric durchgängig und herstellerneutral. Dimensionieren Sie die Leaf- und Spine-Switches, planen Sie die Anzahl der Transceiver und Kabel, vergleichen Sie InfiniBand mit Ethernet für Ihr Cluster und erhalten Sie ein verlustfreies Congestion-Profil. Dieses Werkzeug entwirft ausschließlich das Netzwerk. Es liefert weder eine Kostenschätzung noch eine Stückliste.
GPU-Fabric dimensionieren
Wählen Sie eine Ausgangsgröße oder geben Sie Ihre eigene GPU-Anzahl, Portgeschwindigkeit und Switch-Silicon an. Das Tool dimensioniert einen gefalteten zweistufigen Leaf-Spine-Pod und weist darauf hin, wenn ein Cluster in den dreistufigen Maßstab übergeht.
…
Diese Anzahlen setzen eine gefaltete Leaf-Spine-(Clos-)Fabric mit einer Fabric-NIC pro GPU voraus, wobei jedes Leaf seine Ports zwischen GPUs und Spine-Uplinks aufteilt. Rail-optimierte Verkabelung (mehrere NICs pro GPU) verändert die Verkehrslokalität, nicht diese Switch-Anzahlen. Siehe den AI-Fabric-Topologie-Referenzdesigns für die Rail-Optimized- und dreistufigen Layouts.
Komponentenübersicht
Mengen für Fabric-Verbindungen, Transceiver und Kabel für das dimensionierte Design. Es handelt sich ausschließlich um Planungszahlen, nicht um eine Stückliste, ein Angebot oder eine Preisangabe.
| Component | Basis | Quantity |
|---|---|---|
| GPU-seitige Verbindungen | GPUs × 1 NIC | … |
| Fabric-Links von Leaf zu Spine | leaves × uplinks | … |
| Fabric-Transceiver | links × 2 ends | … |
| Fabric-Kabel | 1 pro Verbindung | … |
Medium nach Reichweite, gewählt entsprechend Ihrer Verkabelung: bis 3 m DAC oder AEC, bis 50 bis 100 m AOC oder SR, bis 500 m DR (das Arbeitspferd), bis 2 km FR. Nur Reichweitenklassen. Keine Preise, SKUs oder Herstellerteilenummern. Fügen Sie bei einem dreistufigen Design zusätzlich zu den obigen Stückzahlen die Spine-zu-Super-Spine-Verbindungen hinzu.
InfiniBand vs. Ethernet
Eine anbieterneutrale Scorecard über sechs Faktoren hinweg. Sie zeigt, in welche Richtung jeder Faktor bei Ihren Eingaben tendiert und warum. Bewusst gibt es hier keinen einzelnen Sieger. Verwenden Sie sie als Eingabe für ein Design-Review, nicht als abschließende Empfehlung.
| Factor | InfiniBand | Ethernet / RoCEv2 | Ultra Ethernet (trajectory) |
|---|---|---|---|
| Spitzenleistungtendiert zu InfiniBand | Ein Roh-Durchsatzvorteil im mittleren Zehnprozentbereich bei geringem Tuning-Aufwand, ergänzt um die SHARP-In-Network-Reduction, die kollektive Operationen von den GPUs auslagert. | Matches InfiniBand with proper tuning. Meta has described training its largest models on a 24,000-GPU RoCEv2 Ethernet cluster in production. The gap is tuning effort, not the ceiling. | Ergänzt Packet Spray und NIC-seitiges Reordering, um die Tail-Latenz zu senken und die PFC-Abhängigkeit zu verringern, und verkleinert so den Out-of-Box-Abstand. |
| Costtendiert zu Ethernet | Bringt in Fabric-Größenordnung einen erheblichen Aufpreis mit sich, der gegenüber vergleichbarem Ethernet üblicherweise mit 30 bis 60 Prozent angegeben wird. | Merchant-Silicon-Switches und eine breite Optik-Lieferkette machen sie in der Regel zur Fabric mit geringeren Kosten pro Port. | Dieselbe Ökonomie offener Merchant-Silicon wie bei Ethernet. |
| Offenheittendiert zu Ethernet | Durchgängiger Single-Vendor-Stack (Switches, NICs, Manager), sodass Multi-Vendor-Beschaffung eingeschränkt ist. | Offen und Multi-Vendor: standardbasierte Switches, NICs und NOS von vielen Anbietern, was die Flexibilität der Lieferkette erhält. | Ein Industriekonsortium-Standard (UEC 1.0, 2025), der die offene Ausrichtung stärkt. |
| Betriebliche Einfachheitneutral | UFM stellt einen einzigen, speziell entwickelten Fabric-Manager bereit, der für Teams ohne tiefgehendes RDMA-Personal schlüsselfertig ist. | Nutzt den großen Ethernet-Talentpool und Standardtooling, doch verlustfreies RoCEv2 erfordert eine sorgfältige End-to-End-Abstimmung. | Zielt darauf ab, den Tuning-Aufwand zu verringern und Ethernet einem IB-ähnlichen Out-of-the-Box-Verhalten anzunähern. |
| Mandantenfähigkeit und Konvergenztendiert zu Ethernet | Typischerweise eine dedizierte Back-End-Insel, ohne native Multi-Tenant-Isolierung oder Storage-Konvergenz. | Eine einzige konvergente Ethernet-Fabric kann Back-End-, Storage- und Front-End-Verkehr mit standardmäßiger Mandantenisolation übertragen. | Erweitert die Converged-Ethernet-Ausrichtung auf einer einzigen offenen Fabric. |
| Trajectorytendiert zu Ethernet | Ausgereift und stabil, mit führender Performance bei geringem Tuning, jedoch an die Roadmap eines einzigen Anbieters gebunden. | Ethernet setzte sich bis Mitte 2025 an die Spitze der AI-Back-End-Bereitstellungen, getragen von einer breiten Ökosystem-Dynamik. | UEC 1.0 (2025) ist eine Multi-Vendor-Spezifikation, die explizit auf AI- und HPC-Back-end-Fabrics abzielt. |
Annahmen: Die Leistung wird mit Tuning verglichen (untuntes Ethernet fällt zurück, gut abgestimmtes Ethernet erreicht Parität); die Kosten werden als Spanne angegeben, nie als konkreter Geldbetrag; Offenheit bedeutet herstellerübergreifende Beschaffung, kein Qualitätsurteil; Ultra Ethernet spiegelt eine Ausrichtung ab 2025 wider, kein verfügbares Produkt. Das Tuning kollektiver Operationen bezieht sich generisch auf xCCL-Bibliotheken. Diese Angaben dienen der Entscheidungsfindung; validieren Sie die Wahl einer Fabric mit einem IP-Infusion-Ingenieur.
RoCEv2-Verlustfrei-Profil
RoCEv2 ist keine einzelne Switch-Funktion. Es handelt sich um ein Profil aus PFC, ECN und ETS, bei dem DCQCN die Arbeit im stationären Zustand übernimmt und PFC als Rückfallebene dient. Dieses Werkzeug empfiehlt die Mechanismen sowie die Reihenfolge, in der sie für Ihr Design angewendet werden sollten. Es gibt keine Schwellenwerte aus und greift auf kein Gerät zu.
| Mechanism | Rolle im verlustfreien Profil | OcNOS-Verfügbarkeit |
|---|---|---|
| PFC | No-Drop-Garantie für die RoCE-Klasse. Rückfallebene für den Notfall, nicht die primäre Steuerung. | Alle 4 AI-Plattformen |
| ECN | Markiert Congestion frühzeitig, damit Sender ihre Rate drosseln, bevor Queues überlaufen. Stellen Sie den Markierungspunkt unterhalb des PFC-Triggers ein. | Alle 4 AI-Plattformen |
| DCQCN (ECN + PFC) | Primäre Steuerung im eingeschwungenen Zustand. Die ECN-Markierung steuert die DCQCN-Reaktion an den NICs; PFC sichert sie ab. Ein zusammengesetzter Mechanismus, keine eigenständige Funktion. | Alle 4 AI-Plattformen |
| ETS | Bandbreitengarantien und Klassenisolierung, damit die verlustfreie Klasse nicht durch Best-Effort-Verkehr ausgehungert wird. | Alle 4 AI-Plattformen |
| PFC-Deadlock-Watchdog | Erkennt und durchbricht PFC-Pause-Deadlocks oder Sturmzustände, das Sicherheitsnetz für das PFC-Backstop. | Alle 4, OcNOS 7.0 |
| DLB (dynamisches Load Balancing) | Spreads elephant RoCE flows that collide under static ECMP, targeting utilization above 90 percent on the same switches. | Alle 4 AI-Plattformen |
| Dynamisches ECN | Passt die ECN-Markierung an die aktuellen Queue-Bedingungen an und reduziert das manuelle Nachjustieren bei Lastverschiebungen. | nur TH5, OcNOS 7.0 |
| DLB reaktiv / zufällig | Erweiterte DLB-Platzierungsmodi für eine engere Flow-Verteilung. Auf TH4 verwenden Sie Standard-DLB. | nur TH5, OcNOS 7.0 |
| GLB (Global Load Balancing) | Fabric-weites Load Balancing über lokale DLB-Entscheidungen hinaus. | Roadmap, OcNOS 7.1 Train |
| Ultra Ethernet | Packet Spray mit Reordering auf NIC-Seite und reduzierter PFC-Abhängigkeit, der Weg zu verlustfreiem AI-Ethernet. | Roadmap, UEC-Profil |
Nur zur Information. Diese Empfehlungen werden an kein Gerät ausgerollt, und hier werden keine Schwellenwerte erzeugt. Die Verfügbarkeit richtet sich nach OcNOS-DC Feature-Matrix und Hardware Compatibility List. Validieren Sie vor dem Deployment gegen die ausgewählten Plattformen und die OcNOS-Release.
Fabric-Stromverbrauch
Ein typischer Leistungsbereich für die Fabric-Switches im dimensionierten Design. Nur Bereiche, mit bestückten Optiken. Netzwerk-Switches machen nur einen kleinen Teil der Gesamtleistung des Clusters aus; die GPUs dominieren.
Kühlung: Rear-Door- oder Direct-Liquid-Kühlung wird typischerweise ab etwa 30 bis 40 kW pro Rack in Betracht gezogen, bedingt durch die Dichte der GPU-Server und nicht durch das Netzwerk. Dies ist eine Orientierung, keine berechnete thermische Last. Die Leistungsbereiche der Switches sind typische Werte für Geräte der Klasse 51,2T (Tomahawk 5) und 25,6T (Tomahawk 4) mit bestückter Optik; bestätigen Sie die genauen Werte anhand des jeweiligen Plattform-Datenblatts.
Passende OcNOS-DC-Plattformen
Die Fabric führt ein einziges OcNOS-DC-Image auf offener Broadcom-Tomahawk-Hardware aus. Dies sind die unterstützten 800G- und 400G-Plattformen, auf die sie ausgelegt wird.




Dieses Werkzeug liefert eine strukturelle Schätzung des Netzwerkdesigns ausschließlich zu Planungszwecken. Es ist weder eine Leistungsgarantie noch eine Stückliste noch eine Kostenschätzung. Tatsächliche Designs hängen von der Rail-Optimierung, der Anzahl der NICs pro GPU, der Verkabelung und den Entscheidungen zur Failure-Domain ab. Die GPU-Zahlen sind Obergrenzen des Referenzdesigns aus der Clos-Radix-Berechnung, keine gemessenen Werte. Broadcom und Tomahawk sind Marken der Broadcom Inc.; andere Namen sind Marken ihrer jeweiligen Inhaber.
AI-Fabric-Referenzdesign
Erhalten Sie das Referenzdesign-PDF: Topologie, Switch-Anzahl, Komponentenübersicht und ein RoCEv2-Lossless-Startprofil.
AI-Fabric-Referenzdesign
Kurzes Formular: Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
Häufig gestellte Fragen
Wie dimensioniere ich eine Leaf-Spine-Fabric für ein GPU-Cluster?
Was ist eine rail-optimierte Topologie?
Wie viele Transceiver benötigt eine AI-Fabric?
Ist RoCEv2 oder InfiniBand besser für KI geeignet?
Wie macht man eine AI Fabric für RoCEv2 verlustfrei?
Läuft dasselbe OcNOS-Image auf jedem Switch in der Fabric?
Die gesamte KI-Fabric mit OcNOS entwerfen
Vom Business Case bis zur Portanzahl-Berechnung: Steigen Sie dort ein, wo Sie beim Aufbau gerade stehen.