AI-Back-End · Storage · Front-End · Coherent DCI

AI-Rechenzentrums-Fabric-Architektur

Ein AI-Rechenzentrum betreibt vier Netzwerkebenen, nicht ein einziges flaches Netzwerk: eine AI-Back-End-Fabric für GPU-zu-GPU-Kollektive, eine Storage-Fabric, eine Front-End-Fabric und eine isolierte Out-of-Band-Management-Ebene. Coherent DCI erweitert das Training über Standorte hinweg, und OcNOS-DC betreibt jede Ebene auf einem einzigen NOS über validierter Broadcom Tomahawk-Hardware.

4 Ebenenplus kohärentes DCI
1 NOSOcNOS-DC auf jeder Ebene
bis zu 800GTomahawk 5, 64x800G
1 Vertragein TAC, ein SLA

Gestalten Sie die Ebenen, nicht nur die Switches

Die meisten AI-Fabric-Fehler sind Scoping-Fehler: Teams dimensionieren die GPU-Ebene und pflanzen Storage, Tenant-Zugang und Management dann nachträglich daran an.

Trennen Sie den Traffic stattdessen nach Ebene und geben Sie jeder das Subscription-Verhältnis und die Isolation, die sie benötigt. Nur die AI-Back-End-Fabric muss blockierungsfrei und verlustfrei sein; die anderen drei existieren, um Traffic von ihr fernzuhalten, der nicht dorthin gehört. Alle vier Ebenen, plus die kohärenten Verbindungen, die Standorte verbinden, laufen auf OcNOS-DC und In der HCL gelistet Tomahawk- und Trident-Hardware.

Jede Ebene hat eine Aufgabe

Dimensionieren Sie jede Ebene für ihre eigene Aufgabe, halten Sie ihren Traffic auf ihren eigenen Leitungen, und die Fabric bleibt unter einem vollständigen Trainingslauf vorhersehbar.

Ebene 1

AI-Back-End-Fabric

Die GPU-zu-GPU-Ebene, die Kollektive überträgt. Aufgebaut 1:1 blockierungsfrei als Rail-optimierter Leaf-Spine-Pod oder dreistufig mit einem Super-Spine, auf einem reinen Layer-3-eBGP-Underlay, und verlustfrei gehalten mit der RoCEv2-Fabric, die RDMA erfordert: PFC (einschließlich über L3, mit DCBX/LLDP) und ECN. DLB verteilt Flows, sodass während AllReduce kein Link zum Hotspot wird.

1:1 blockierungsfrei · RoCEv2 (PFC + ECN) · DLB · TH5 800G
Ebene 2

Storage-Fabric

Eine Leaf-Spine-Clos, die Checkpoints und Datensätze zwischen den GPU-Racks und NVMe-oF- oder NFS-Storage verschiebt. Typischerweise dimensioniert nahe 3:1, da Storage-Bursts mehr Oversubscription tolerieren als Kollektive, und verlustfrei gehalten, damit RDMA-Storage-Traffic unter Last nicht verworfen wird.

Leaf-Spine-Clos · ~3:1 · verlustfreies RDMA · NVMe-oF / NFS
Ebene 3

Front-End-Fabric

Die Nord-Süd-Ebene für Tenant-Zugang, Inferenz-Serving und den Weg nach außen zum übrigen Rechenzentrum und zum Internet. Betreibt 400G- oder 800G-Zugang, dimensioniert nach dem Service-Traffic, den sie transportiert, statt nach dem kollektiven Muster der Back-End-Ebene.

Nord-Süd · Tenant / Inferenz · 400G / 800G
Ebene 4

Out-of-Band-Management

Eine separate Clos- oder MLAG-Ebene auf eigenen Leitungen, sodass Inbetriebnahme und Monitoring niemals das Schicksal der Datenebenen teilen. Transportiert ZTP, SNMP und syslog sowie gNMI/OpenConfig-Streaming-Telemetrie und funktioniert weiter, während eine Datenebenen-Fabric neu konfiguriert wird.

Isolierte Ebene · ZTP · SNMP / syslog · gNMI-Telemetrie

Vier Fabrics plus DCI, auf einem NOS

Ein Rechenzentrum, vier Ebenen, über kohärente Optik auf einen zweiten Standort erweitert. Die AI-Back-End-Ebene ist 1:1 blockierungsfrei; Storage, Front-End und Management laufen jeweils mit dem Verhältnis, das ihr Traffic benötigt. Jede Ebene betreibt OcNOS-DC, und die ZR+-DCI-Verbindung skaliert das Training über Standorte hinweg ohne externe Transponder.

Architektur der AI-Rechenzentrums-Fabric: vier Ebenen plus kohärentes DCI zu einem zweiten Standort Ein einzelnes AI-Rechenzentrum, dargestellt als vier gestapelte Netzebenen: eine AI-Back-End-Fabric (1:1 nicht blockierend, verlustfreies RoCEv2, DLB), eine Storage-Fabric (etwa 3:1, NVMe-oF und NFS), eine Front-End-Fabric (400G und 800G Nord-Süd) und eine isolierte Out-of-Band-Management-Ebene (ZTP, SNMP, Syslog, gNMI-Telemetrie). Auf allen vier Ebenen läuft OcNOS-DC. Ein kohärenter 400G-ZR- und ZR+- oder 800G-ZR-DCI-Link verbindet den Standort mit einem zweiten Rechenzentrum; 400ZR deckt Metro-Distanzen bis etwa 120 km ab, OpenZR+ reicht weiter. Unteres Band: ein NOS über AI-Back-End, Storage, Front-End, Out-of-Band-Management und kohärentes DCI. RECHENZENTRUM A · OcNOS-DC AI-Back-End-Fabric GPU-Collectives · Rail-optimiert / Clos 1:1 nicht blockierend · RoCEv2 · DLB Storage-Fabric Checkpoints / Datensätze · verlustfreies RDMA ~3:1 · NVMe-oF / NFS Front-End-Fabric Nord-Süd · Mandanten / Inferenz 400G / 800G Out-of-Band-Mgmt ZTP · SNMP / Syslog · Telemetrie isolierte Ebene · gNMI RECHENZENTRUM B AI-Back-End-Fabric 1:1 nicht blockierend · RoCEv2 Storage + Front-End ~3:1 · 400G / 800G Out-of-Band-Mgmt ZR+ DCI 400G ZR / ZR+ · 800G ZR COHERENT · 400ZR UP TO ~120 KM · OPENZR+ FARTHER (oFEC) EIN NOS · OcNOS-DC · AI-BACK-END · STORAGE · FRONT-END · OOB · KOHÄRENTES DCI

OcNOS-Komponenten: ein geroutetes eBGP-unnumbered Underlay pro Ebene (das AI-Back-End ist reines Layer-3-eBGP, wobei EVPN-VXLAN als Tenant-Overlay statt als AI-Underlay dient), RoCEv2-verlustfrei (PFC + ECN, PFC über L3 mit DCBX/LLDP) und DLB auf den Back-End- und Storage-Ebenen, eine isolierte Management-Ebene für ZTP und gNMI-Telemetrie sowie 400G ZR und ZR+ oder 800G ZR kohärente Optik für DCI auf AIS800-64D, S9321-64E und AS9736-64D. Die Back-End-Ebenen sind auf HCL-gelisteter Tomahawk 5- (Edgecore AIS800-64D, UfiSpace S9321-64E / 64EO) und Tomahawk 4- (Edgecore AS9736-64D) Hardware aufgebaut; die Management-Ebene betreibt das OcNOS-DC-MGMT-Image auf Trident 3-Switches.

Kohärentes DCI, keine externen Transponder

Wenn ein einzelner Trainingslauf über eine Datenhalle hinauswächst, erweitert sich die Fabric über das WAN auf 400G ZR+ oder 800G ZR kohärenter steckbarer Optik, direkt von einem Border-Port.

Bei OcNOS-DC läuft 800G-ZR-Optik auf den Tomahawk 5-Plattformen Edgecore AIS800-64D und UfiSpace S9321-64E, 400G-ZR- und OpenZR+-Optik auf der Tomahawk 4-Plattform Edgecore AS9736-64D. 400ZR deckt Metro-Distanzen bis etwa 120 km ab, OpenZR+ mit oFEC reicht weiter, während jeder Standort seine eigene Leaf-Spine-Fabric unverändert behält. Siehe die kohärentes DCI Detailanalyse zu Optik und Reichweite.

Welche Hardware betreibt jede Ebene

Die AI-Back-End-, Storage- und Front-End-Ebenen betreiben OcNOS-DC auf Broadcom Tomahawk-Silizium. Die 800G-Ebenen und DCI setzen auf Tomahawk 5; Entry- und 400G-Ebenen setzen auf Tomahawk 4. Beide sind On-Chip-Shared-Buffer-Switches. Die Out-of-Band-Management-Ebene betreibt das OcNOS-DC-MGMT-Image auf Trident 3 1G/10G-Switches, und jede Plattform steht auf der OcNOS Hardware Compatibility List.

Silizium-Schicht Tomahawk 5800G-Ebenen + DCI Tomahawk 4Entry- + 400G-Ebenen
Broadcom-BausteinBCM78900BCM56990
Switch-Kapazität51,2 Tbps25.6 Tbps
Port-Konfiguration64×800G64×400G
PufferOn-Chip-Shared-Buffer; HCL-gelistet.On-Chip-Shared-Buffer; HCL-gelistet.
PlattformenEdgecore AIS800-64D, UfiSpace S9321-64E, UfiSpace S9321-64EO. 800G-ZR-Optik auf AIS800-64D und S9321-64E.Edgecore AS9736-64D.
Rolle im DesignAI-Back-End- und Storage-Ebenen mit 800G, plus kohärentes DCI über Standorte hinweg.Entry-Aufbauten und 400G-Front-End- oder Management-Ebenen.

Die Stärke eines einzigen NOS

Die vier Ebenen und die DCI-Verbindungen sind nicht vier Produkte. Sie sind ein Betriebssystem in vier Rollen: OcNOS-DC betreibt die AI-Back-End-, Storage-, Front-End- und Out-of-Band-Management-Fabrics sowie kohärentes DCI, mit einem Konfigurationsmodell und einem Telemetrie-Stack über gNMI und OpenConfig. Das Team lernt eine CLI, eine Automatisierungsoberfläche und einen Satz Zähler für jede Ebene.

Ein Betriebsmodell

Dasselbe Routing-, QoS- und Telemetrie-Modell gilt, ob ein Port ein GPU-zugewandter Back-End-Leaf, ein Storage-Leaf, ein Front-End-Border oder ein Management-Switch ist.

Ein Supportvertrag

Ein einziger IP Infusion-Vertrag deckt die Software und die validierte Hardware ab, mit einem TAC und einem SLA über alle Ebenen hinweg. Kein gegenseitiges Schuldzuweisen zwischen einem NOS-Anbieter und einem Hardware-Anbieter.

Eine Hardware-Liste

Jede Ebene wird aus derselben OcNOS Hardware Compatibility List aufgebaut, sodass Support, Optik und Firmware über das gesamte Design hinweg konsistent bleiben.

Eine Roadmap zum Hineinwachsen

Fabric-weites GLB kommt mit OcNOS 7.1. Auf der Roadmap: latenzbasiertes ECN (7.1.0) sowie LLR, CBFS und Packet Trimming. Das kommende Tomahawk-6-Silicon (BCM78910 / BCM78914, 102.4 Tbps, TSMC 3nm) ist auf dem OcNOS-7.2-Train und erweitert dasselbe Design mit höherer Radix. Bauen Sie die Telemetrie-Ebene vom ersten Tag an ein, damit diese Funktionen als Softwareschritte kommen.

FAQ zur AI-Fabric-Architektur

Aus welchen Fabrics besteht ein AI-Rechenzentrum?
Ein AI-Rechenzentrum betreibt vier Netzwerk-Ebenen. Die AI-Back-End-Fabric transportiert kollektiven GPU-zu-GPU-Traffic und ist diejenige, die blockierungsfrei und verlustfrei sein muss. Die Storage-Fabric bewegt Checkpoints und Datensätze über RDMA zu und von den GPU-Racks. Die Front-End-Fabric übernimmt Nord-Süd-, Tenant- und Inferenz-Zugang. Eine separate Out-of-Band-Management -Ebene nimmt Switches in Betrieb und streamt Telemetrie auf eigenen Leitungen. Kohärentes DCI erweitert das Design über Standorte hinweg. OcNOS-DC betreibt alle vier Ebenen plus DCI.
Welche Überbuchung sollte jede Fabric verwenden?
Die AI-Back-End-Fabric sollte 1:1 blockierungsfrei auf der GPU-Ebene liegen, denn ein überlasteter Link dort blockiert das gesamte Kollektiv, und jede GPU wartet auf die langsamste Übertragung. Die Storage-Fabric läuft typischerweise mit einem kostenoptimierten Verhältnis nahe 3:1, da Storage-Bursts weniger latenzkritisch sind als Kollektive. Die Front-End- und Out-of-Band-Management-Ebenen transportieren leichteren, weniger stoßartigen Traffic und tolerieren höhere Überbuchung. Passen Sie das Verhältnis an den Traffic an, den jede Ebene tatsächlich transportiert.
Wie verbindet man zwei AI-Rechenzentren?
Nutzen Sie kohärentes DCI: steckbare 400G-ZR- und ZR+- oder 800G-ZR-Optiken an einem Border-Port, ohne externe Transponder. Auf OcNOS-DC werden 800G-ZR-Optiken auf den Tomahawk 5-Plattformen Edgecore AIS800-64D und UfiSpace S9321-64E unterstützt, 400G-ZR- und OpenZR+-Optiken auf der Tomahawk 4-Plattform Edgecore AS9736-64D. 400ZR deckt Metro-DCI-Distanzen bis etwa 120 km ab, OpenZR+ mit oFEC reicht weiter. So kann ein einzelner Trainingslauf mehr als eine Rechenzentrumshalle umfassen, während jeder Standort seine eigene Leaf-Spine-Fabric unverändert behält.
Kann ein NOS alle Fabrics betreiben?
Ja. OcNOS-DC betreibt die AI-Back-End-, Storage-, Front-End- und Out-of-Band-Management-Ebenen sowie kohärentes DCI auf demselben Betriebssystem. Das bedeutet ein Konfigurationsmodell, einen Telemetrie-Stack über gNMI und OpenConfig und einen einzigen IP Infusion-Supportvertrag der die Software und die validierte Hardware abdeckt, mit einem TAC und einem SLA über jede Ebene im Design hinweg.
Welche Hardware betreibt jede Ebene?
Die AI-Back-End-, Storage- und Front-End-Ebenen betreiben OcNOS-DC auf Broadcom Tomahawk Silicon. Die 800G-Ebenen nutzen Tomahawk 5 (BCM78900, 51,2 Tbps, 64×800G): Edgecore AIS800-64D, UfiSpace S9321-64E oder UfiSpace S9321-64EO. Einstiegs- und 400G-Ebenen nutzen Tomahawk 4 (BCM56990, 25,6 Tbps, 64×400G), etwa den Edgecore AS9736-64D. Es handelt sich um Switches mit On-Chip-Shared-Buffer. Die Out-of-Band-Management-Ebene betreibt das OcNOS-DC-MGMT-Image auf Trident 3 1G/10G-Switches, etwa dem Edgecore AS4625-54T. Alle Plattformen sind in der OcNOS Hardware-Kompatibilitätsliste aufgeführt.

Planen Sie das komplette AI-Rechenzentrum? Wir planen jede Ebene gemeinsam mit Ihnen.

Nennen Sie uns die GPU-Größenordnung und den Workload, und ein IP Infusion-Ingenieur dimensioniert die Back-End-, Storage-, Front-End-, Management- und DCI-Ebenen gemeinsam mit Ihnen, oder beginnen Sie mit einem ersten Entwurf in der AI Fabric Design Suite.