AI-Rechenzentrums-Fabric-Architektur
Ein AI-Rechenzentrum betreibt vier Netzwerkebenen, nicht ein einziges flaches Netzwerk: eine AI-Back-End-Fabric für GPU-zu-GPU-Kollektive, eine Storage-Fabric, eine Front-End-Fabric und eine isolierte Out-of-Band-Management-Ebene. Coherent DCI erweitert das Training über Standorte hinweg, und OcNOS-DC betreibt jede Ebene auf einem einzigen NOS über validierter Broadcom Tomahawk-Hardware.
Gestalten Sie die Ebenen, nicht nur die Switches
Die meisten AI-Fabric-Fehler sind Scoping-Fehler: Teams dimensionieren die GPU-Ebene und pflanzen Storage, Tenant-Zugang und Management dann nachträglich daran an.
Trennen Sie den Traffic stattdessen nach Ebene und geben Sie jeder das Subscription-Verhältnis und die Isolation, die sie benötigt. Nur die AI-Back-End-Fabric muss blockierungsfrei und verlustfrei sein; die anderen drei existieren, um Traffic von ihr fernzuhalten, der nicht dorthin gehört. Alle vier Ebenen, plus die kohärenten Verbindungen, die Standorte verbinden, laufen auf OcNOS-DC und In der HCL gelistet Tomahawk- und Trident-Hardware.
Jede Ebene hat eine Aufgabe
Dimensionieren Sie jede Ebene für ihre eigene Aufgabe, halten Sie ihren Traffic auf ihren eigenen Leitungen, und die Fabric bleibt unter einem vollständigen Trainingslauf vorhersehbar.
AI-Back-End-Fabric
Die GPU-zu-GPU-Ebene, die Kollektive überträgt. Aufgebaut 1:1 blockierungsfrei als Rail-optimierter Leaf-Spine-Pod oder dreistufig mit einem Super-Spine, auf einem reinen Layer-3-eBGP-Underlay, und verlustfrei gehalten mit der RoCEv2-Fabric, die RDMA erfordert: PFC (einschließlich über L3, mit DCBX/LLDP) und ECN. DLB verteilt Flows, sodass während AllReduce kein Link zum Hotspot wird.
Storage-Fabric
Eine Leaf-Spine-Clos, die Checkpoints und Datensätze zwischen den GPU-Racks und NVMe-oF- oder NFS-Storage verschiebt. Typischerweise dimensioniert nahe 3:1, da Storage-Bursts mehr Oversubscription tolerieren als Kollektive, und verlustfrei gehalten, damit RDMA-Storage-Traffic unter Last nicht verworfen wird.
Front-End-Fabric
Die Nord-Süd-Ebene für Tenant-Zugang, Inferenz-Serving und den Weg nach außen zum übrigen Rechenzentrum und zum Internet. Betreibt 400G- oder 800G-Zugang, dimensioniert nach dem Service-Traffic, den sie transportiert, statt nach dem kollektiven Muster der Back-End-Ebene.
Out-of-Band-Management
Eine separate Clos- oder MLAG-Ebene auf eigenen Leitungen, sodass Inbetriebnahme und Monitoring niemals das Schicksal der Datenebenen teilen. Transportiert ZTP, SNMP und syslog sowie gNMI/OpenConfig-Streaming-Telemetrie und funktioniert weiter, während eine Datenebenen-Fabric neu konfiguriert wird.
Vier Fabrics plus DCI, auf einem NOS
Ein Rechenzentrum, vier Ebenen, über kohärente Optik auf einen zweiten Standort erweitert. Die AI-Back-End-Ebene ist 1:1 blockierungsfrei; Storage, Front-End und Management laufen jeweils mit dem Verhältnis, das ihr Traffic benötigt. Jede Ebene betreibt OcNOS-DC, und die ZR+-DCI-Verbindung skaliert das Training über Standorte hinweg ohne externe Transponder.
OcNOS-Komponenten: ein geroutetes eBGP-unnumbered Underlay pro Ebene (das AI-Back-End ist reines Layer-3-eBGP, wobei EVPN-VXLAN als Tenant-Overlay statt als AI-Underlay dient), RoCEv2-verlustfrei (PFC + ECN, PFC über L3 mit DCBX/LLDP) und DLB auf den Back-End- und Storage-Ebenen, eine isolierte Management-Ebene für ZTP und gNMI-Telemetrie sowie 400G ZR und ZR+ oder 800G ZR kohärente Optik für DCI auf AIS800-64D, S9321-64E und AS9736-64D. Die Back-End-Ebenen sind auf HCL-gelisteter Tomahawk 5- (Edgecore AIS800-64D, UfiSpace S9321-64E / 64EO) und Tomahawk 4- (Edgecore AS9736-64D) Hardware aufgebaut; die Management-Ebene betreibt das OcNOS-DC-MGMT-Image auf Trident 3-Switches.
Kohärentes DCI, keine externen Transponder
Wenn ein einzelner Trainingslauf über eine Datenhalle hinauswächst, erweitert sich die Fabric über das WAN auf 400G ZR+ oder 800G ZR kohärenter steckbarer Optik, direkt von einem Border-Port.
Bei OcNOS-DC läuft 800G-ZR-Optik auf den Tomahawk 5-Plattformen Edgecore AIS800-64D und UfiSpace S9321-64E, 400G-ZR- und OpenZR+-Optik auf der Tomahawk 4-Plattform Edgecore AS9736-64D. 400ZR deckt Metro-Distanzen bis etwa 120 km ab, OpenZR+ mit oFEC reicht weiter, während jeder Standort seine eigene Leaf-Spine-Fabric unverändert behält. Siehe die kohärentes DCI Detailanalyse zu Optik und Reichweite.
Welche Hardware betreibt jede Ebene
Die AI-Back-End-, Storage- und Front-End-Ebenen betreiben OcNOS-DC auf Broadcom Tomahawk-Silizium. Die 800G-Ebenen und DCI setzen auf Tomahawk 5; Entry- und 400G-Ebenen setzen auf Tomahawk 4. Beide sind On-Chip-Shared-Buffer-Switches. Die Out-of-Band-Management-Ebene betreibt das OcNOS-DC-MGMT-Image auf Trident 3 1G/10G-Switches, und jede Plattform steht auf der OcNOS Hardware Compatibility List.
| Silizium-Schicht | Tomahawk 5800G-Ebenen + DCI | Tomahawk 4Entry- + 400G-Ebenen |
|---|---|---|
| Broadcom-Baustein | BCM78900 | BCM56990 |
| Switch-Kapazität | 51,2 Tbps | 25.6 Tbps |
| Port-Konfiguration | 64×800G | 64×400G |
| Puffer | On-Chip-Shared-Buffer; HCL-gelistet. | On-Chip-Shared-Buffer; HCL-gelistet. |
| Plattformen | Edgecore AIS800-64D, UfiSpace S9321-64E, UfiSpace S9321-64EO. 800G-ZR-Optik auf AIS800-64D und S9321-64E. | Edgecore AS9736-64D. |
| Rolle im Design | AI-Back-End- und Storage-Ebenen mit 800G, plus kohärentes DCI über Standorte hinweg. | Entry-Aufbauten und 400G-Front-End- oder Management-Ebenen. |
Die Stärke eines einzigen NOS
Die vier Ebenen und die DCI-Verbindungen sind nicht vier Produkte. Sie sind ein Betriebssystem in vier Rollen: OcNOS-DC betreibt die AI-Back-End-, Storage-, Front-End- und Out-of-Band-Management-Fabrics sowie kohärentes DCI, mit einem Konfigurationsmodell und einem Telemetrie-Stack über gNMI und OpenConfig. Das Team lernt eine CLI, eine Automatisierungsoberfläche und einen Satz Zähler für jede Ebene.
Ein Betriebsmodell
Dasselbe Routing-, QoS- und Telemetrie-Modell gilt, ob ein Port ein GPU-zugewandter Back-End-Leaf, ein Storage-Leaf, ein Front-End-Border oder ein Management-Switch ist.
Ein Supportvertrag
Ein einziger IP Infusion-Vertrag deckt die Software und die validierte Hardware ab, mit einem TAC und einem SLA über alle Ebenen hinweg. Kein gegenseitiges Schuldzuweisen zwischen einem NOS-Anbieter und einem Hardware-Anbieter.
Eine Hardware-Liste
Jede Ebene wird aus derselben OcNOS Hardware Compatibility List aufgebaut, sodass Support, Optik und Firmware über das gesamte Design hinweg konsistent bleiben.
Eine Roadmap zum Hineinwachsen
Fabric-weites GLB kommt mit OcNOS 7.1. Auf der Roadmap: latenzbasiertes ECN (7.1.0) sowie LLR, CBFS und Packet Trimming. Das kommende Tomahawk-6-Silicon (BCM78910 / BCM78914, 102.4 Tbps, TSMC 3nm) ist auf dem OcNOS-7.2-Train und erweitert dasselbe Design mit höherer Radix. Bauen Sie die Telemetrie-Ebene vom ersten Tag an ein, damit diese Funktionen als Softwareschritte kommen.
FAQ zur AI-Fabric-Architektur
Aus welchen Fabrics besteht ein AI-Rechenzentrum?
Welche Überbuchung sollte jede Fabric verwenden?
Wie verbindet man zwei AI-Rechenzentren?
Kann ein NOS alle Fabrics betreiben?
Welche Hardware betreibt jede Ebene?
Tiefer einsteigen. Zum Mitnehmen.
Das Produktdatenblatt und kurze, technische Downloads, die über diese Seite hinausgehen.
OcNOS-DC-Datenblatt
Vollständige OcNOS-DC-Spezifikation: Funktionsumfang für EVPN-VXLAN und Ethernet for AI, Software-SKUs, unterstützte Hardware-Plattformen und der Solution Ordering Guide.
Datenblatt abrufenOcNOS: verlustfreie 800G-AI-Fabric
Non-Blocking-RoCEv2-Fabric auf Broadcom-Tomahawk-4/5-Spines: SKU-Stufen, validierte Plattformen und Deployment-Architektur.
Brief anfordernEVPN-VXLAN-Data-Center-Fabric
Carrier-Grade-Leaf-Spine-Data-Center-Fabric: symmetrisches IRB, Type-2/Type-5-Routen und verteiltes Anycast-Gateway.
Brief anfordernOcNOS-DC-Datenblatt
Kurzes Formular. Ihr PDF öffnet sich unmittelbar nach dem Absenden in einem neuen Tab.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
OcNOS: verlustfreie 800G-AI-Fabric
Kurzes Formular. Ihr PDF öffnet sich unmittelbar nach dem Absenden in einem neuen Tab.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
EVPN-VXLAN-Data-Center-Fabric
Kurzes Formular. Ihr PDF öffnet sich unmittelbar nach dem Absenden in einem neuen Tab.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
Planen Sie das komplette AI-Rechenzentrum? Wir planen jede Ebene gemeinsam mit Ihnen.
Nennen Sie uns die GPU-Größenordnung und den Workload, und ein IP Infusion-Ingenieur dimensioniert die Back-End-, Storage-, Front-End-, Management- und DCI-Ebenen gemeinsam mit Ihnen, oder beginnen Sie mit einem ersten Entwurf in der AI Fabric Design Suite.
Die gesamte AI-Fabric mit OcNOS entwerfen
Vom Business Case bis zur Portanzahl-Berechnung: Steigen Sie dort ein, wo Sie beim Aufbau gerade stehen.