Back-end IA · Stockage · Front-end · DCI cohérent

Architecture de fabric de centre de données IA

Un centre de données IA exploite quatre plans réseau, et non un seul réseau à plat : un fabric back-end IA pour les collectifs GPU-à-GPU, un fabric de stockage, un fabric front-end et un plan de gestion hors bande isolé. Le DCI cohérent étend l'entraînement à travers les sites, et OcNOS-DC exploite chaque plan sur un seul NOS au-dessus de matériel Broadcom Tomahawk validé.

4 planesplus DCI cohérent
1 NOSOcNOS-DC sur chaque plan
jusqu'à 800GTomahawk 5, 64x800G
1 contractun seul TAC, un seul SLA
Périmètre par plan

Concevez les plans, pas seulement les commutateurs

La plupart des erreurs de fabric IA sont des erreurs de périmètre : les équipes dimensionnent le plan GPU, puis y greffent le stockage, l'accès locataire et la gestion après coup.

Séparez plutôt le trafic par plan, et donnez à chacun le ratio de souscription et l'isolation dont il a besoin. Seul le fabric back-end IA doit être non bloquant et sans perte ; les trois autres existent pour en tenir à l'écart le trafic qui n'y a pas sa place. Les quatre plans, plus les liens cohérents qui relient les sites, fonctionnent sur OcNOS-DC on HCL-listed du matériel Tomahawk.

Les quatre fabrics

Chaque plan a une seule mission

Dimensionnez chaque plan pour sa propre mission, gardez son trafic sur ses propres câbles, et le fabric reste prévisible pendant un entraînement complet.

Plane 1

Fabric back-end IA

Le plan GPU-à-GPU qui transporte les collectifs. Bâti 1:1 non bloquant sous forme de pod leaf-spine rail-optimized ou de Clos à 3 étages sur un underlay eBGP purement Layer 3, et maintenu sans perte avec le fabric RoCEv2 que le RDMA exige : PFC (y compris sur L3, avec DCBX/LLDP) et ECN. DLB répartit les flux afin qu'aucun lien ne devienne un point chaud pendant l'AllReduce.

1:1 non bloquant · RoCEv2 (PFC + ECN) · DLB · TH5 800G
Plane 2

Fabric de stockage

Un Clos leaf-spine qui déplace les points de contrôle et les jeux de données entre les racks GPU et le stockage NVMe-oF ou NFS. Généralement dimensionné autour de 3:1, puisque les rafales de stockage tolèrent plus de sursouscription que les collectifs, et maintenu sans perte afin que le trafic de stockage RDMA ne soit pas perdu sous charge.

Clos leaf-spine · ~3:1 · RDMA sans perte · NVMe-oF / NFS
Plane 3

Fabric front-end

Le plan nord-sud pour l'accès des locataires, le service d'inférence et le chemin vers le reste du data center et Internet. Il assure un accès 400G ou 800G, dimensionné selon le trafic de service qu'il transporte plutôt que selon le motif collectif du plan back-end.

Nord-sud · locataire / inférence · 400G / 800G
Plane 4

Gestion hors bande

Un plan Clos ou MLAG distinct sur son propre câblage, afin que la mise en service et la supervision ne partagent jamais le sort des plans de données. Il transporte ZTP, SNMP et syslog, ainsi que la télémétrie en streaming gNMI/OpenConfig, et continue de fonctionner pendant la reconfiguration d'un fabric de plan de données.

Plan isolé · ZTP · SNMP / syslog · télémétrie gNMI
Architecture de référence

Quatre fabrics plus le DCI, sur un seul NOS

Un data center, quatre plans, étendu à un second site via optique cohérente. Le plan back-end IA est non bloquant 1:1 ; le stockage, le front-end et la gestion fonctionnent chacun au ratio requis par leur trafic. Chaque plan exécute OcNOS-DC, et la liaison DCI ZR+ met l'entraînement à l'échelle entre les sites sans transpondeurs externes.

AI data center fabric architecture: four planes plus coherent DCI to a second site A single AI data center shown as four stacked network planes: an AI back-end fabric (1:1 non-blocking, RoCEv2 lossless, DLB), a storage fabric (roughly 3:1, NVMe-oF and NFS), a front-end fabric (400G and 800G north-south), and an isolated out-of-band management plane (ZTP, SNMP, syslog, gNMI telemetry). All four planes run OcNOS-DC. A 400G/800G ZR+ coherent DCI link on the UfiSpace S9321-64EO connects the site to a second data center, with multi-DC training reach commonly under about 30 km on ZR+ and longer on OpenZR+. Bottom band: one NOS across AI back-end, storage, front-end, out-of-band management, and coherent DCI. DATA CENTER A · OcNOS-DC Fabric back-end IA GPU collectives · rail-optimized / Clos 1:1 non-blocking · RoCEv2 · DLB Fabric de stockage checkpoints / datasets · lossless RDMA ~3:1 · NVMe-oF / NFS Fabric front-end north-south · tenant / inference 400G / 800G Out-of-band mgmt ZTP · SNMP / syslog · telemetry isolated plane · gNMI DATA CENTER B Fabric back-end IA 1:1 non-blocking · RoCEv2 Storage + front-end ~3:1 · 400G / 800G Out-of-band mgmt ZR+ DCI 400G / 800G ZR+ COHERENT · S9321-64EO · UNDER ~30 KM ZR+ · OPENZR+ FARTHER (oFEC) ONE NOS · OcNOS-DC · AI BACK-END · STORAGE · FRONT-END · OOB · COHERENT DCI

Composants OcNOS : un underlay routé eBGP-unnumbered par plan (le back-end IA est du pur eBGP Layer 3, avec EVPN-VXLAN conservé comme overlay locataire plutôt que comme underlay IA), du RoCEv2 sans perte (PFC + ECN, PFC over L3 avec DCBX/LLDP) et du DLB sur les plans back-end et stockage, un plan de gestion isolé pour ZTP et la télémétrie gNMI, et des optiques cohérentes 400G/800G ZR+ sur le S9321-64EO pour le DCI. Construit sur du matériel Tomahawk 5 référencé dans la HCL (Edgecore AIS800-64D, UfiSpace S9321-64E / 64EO) et Tomahawk 4 (Edgecore AS9736-64D).

Faire evoluer entre les sites

DCI cohérent, sans transpondeurs externes

Lorsqu'un même run d'entraînement dépasse une salle de données, le fabric s'étend sur le WAN via des optiques enfichables cohérentes 400G et 800G ZR+, directement depuis un port de bordure.

The UfiSpace S9321-64EO est la plateforme Tomahawk 5 qui ajoute des optiques cohérentes 400G ZR+ pour le DCI. La portée est généralement inférieure à environ 30 km en ZR+, et davantage en OpenZR+ avec l'oFEC : suffisamment proche pour maintenir la latence collective dans le budget tout en laissant chaque site conserver son propre fabric leaf-spine inchangé. Consultez le DCI cohérent dossier approfondi pour le détail des optiques et de la portée.

The silicon

Quel matériel exécute chaque plan

Chaque plan exécute OcNOS-DC sur du silicon Broadcom Tomahawk. Les plans 800G et le DCI reposent sur Tomahawk 5 ; les plans d'entrée de gamme et 400G reposent sur Tomahawk 4. Ce sont tous deux des commutateurs à buffer partagé on-chip, et chaque plateforme figure sur la liste de compatibilité matérielle (HCL) OcNOS.

Couche silicon Tomahawk 5Plans 800G + DCI Tomahawk 4Plans d'entrée de gamme + 400G
Référence BroadcomBCM78900BCM56990
Capacité du commutateur51,2 Tbps25,6 Tbps
Configuration des ports64×800G64×400G
BufferBuffer partagé on-chip ; référencé dans la HCL.Buffer partagé on-chip ; référencé dans la HCL.
PlateformesEdgecore AIS800-64D, UfiSpace S9321-64E. Le S9321-64EO ajoute des optiques cohérentes 400G ZR+ pour le DCI.Edgecore AS9736-64D.
Rôle dans la conceptionPlans back-end IA et stockage à 800G, plus le DCI cohérent entre les sites.Déploiements d'entrée de gamme et plans front-end ou de gestion 400G.
Un NOS, quatre rôles

La puissance d'un seul NOS

Les quatre plans et les liaisons DCI ne sont pas quatre produits. Ils constituent un seul système d'exploitation dans quatre rôles : OcNOS-DC exécute les fabrics back-end IA, stockage, front-end et de gestion hors bande, plus le DCI cohérent, avec un seul modèle de configuration et une seule pile de télémétrie sur gNMI et OpenConfig. L'équipe apprend une seule CLI, une seule surface d'automatisation et un seul ensemble de compteurs pour chaque plan.

Un modèle opérationnel unique

Le même modèle de routage, de QoS et de télémétrie s'applique qu'un port soit un leaf back-end côté GPU, un leaf de stockage, une bordure front-end ou un commutateur de gestion.

Un seul contrat de support

Un seul contrat IP Infusion couvre le logiciel et le matériel validé, avec un seul TAC et un seul SLA sur l'ensemble des plans. Aucun renvoi de responsabilité entre un fournisseur de NOS et un fournisseur de matériel.

Une seule liste de matériel

Chaque plan est construit à partir de la même liste de compatibilité matérielle OcNOS, de sorte que le support, les optiques et le firmware restent cohérents dans toute la conception.

Une feuille de route pour évoluer

Sur la feuille de route : le GLB à l'échelle du fabric (OcNOS 7.1), l'ECN basé sur la latence (7.1.0), ainsi que LLR, CBFS et le packet trimming. Le futur silicon Tomahawk 6 (BCM78910 / BCM78914, 102.4 Tbps, TSMC 3nm) s'inscrit dans la lignée OcNOS 7.2 et étend la même conception à un radix supérieur. Intégrez le plan de télémétrie dès le premier jour pour que ces éléments arrivent comme de simples étapes logicielles.

FAQ

FAQ sur l'architecture du fabric IA

Quels fabrics composent un data center IA ?
Un data center IA exécute quatre plans réseau. Le Fabric back-end IA transporte le trafic collectif GPU-à-GPU et c'est celui qui doit être non bloquant et sans perte. Le fabric de stockage déplace les checkpoints et les jeux de données vers et depuis les racks GPU via RDMA. Le fabric front-end gère l'accès nord-sud, locataire et d'inférence. Un plan distinct de gestion hors bande met les commutateurs en service et diffuse la télémétrie sur son propre câblage. Le DCI cohérent étend la conception entre les sites. OcNOS-DC exécute les quatre plans plus le DCI.
Quel taux de sursouscription chaque fabric doit-il utiliser ?
Le fabric back-end IA doit être 1:1 non bloquant sur le plan GPU, car un lien saturé y bloque l'ensemble du collectif et chaque GPU attend le transfert le plus lent. Le fabric de stockage fonctionne généralement à un ratio optimisé en coût proche de 3:1, puisque les rafales de stockage sont moins sensibles à la latence que les collectifs. Les plans front-end et de gestion hors bande transportent un trafic plus léger, moins irrégulier, et tolèrent une sursouscription plus élevée. Adaptez le ratio au trafic que chaque plan transporte réellement.
Comment connecter deux data centers IA ?
Utilisez le DCI cohérent : des optiques enfichables 400G et 800G ZR+ sur un port de bordure, sans transpondeurs externes. Sur OcNOS-DC, le UfiSpace S9321-64EO ajoute des optiques cohérentes 400G ZR+ précisément pour cela. La portée d'entraînement multi-DC est généralement inférieure à environ 30 km en ZR+, et davantage en OpenZR+ avec l'oFEC. Cela permet à un même run d'entraînement de couvrir plus d'une salle de données tout en laissant chaque site conserver son propre fabric leaf-spine inchangé.
Un seul NOS peut-il exécuter tous les fabrics ?
Yes. OcNOS-DC exécute les plans back-end IA, stockage, front-end et de gestion hors bande, plus le DCI cohérent, sur le même système d'exploitation. Cela signifie un seul modèle de configuration, une seule pile de télémétrie sur gNMI et OpenConfig, et un seul contrat de support IP Infusion couvrant le logiciel et le matériel validé, avec un seul TAC et un seul SLA sur chaque plan de la conception.
Quel matériel exécute chaque plan ?
Les quatre plans exécutent OcNOS-DC sur du silicon Broadcom Tomahawk. Les plans 800G utilisent Tomahawk 5 (BCM78900, 51.2 Tbps, 64×800G) : Edgecore AIS800-64D ou UfiSpace S9321-64E, le S9321-64EO ajoutant des optiques cohérentes 400G ZR+ pour le DCI. Les plans d'entrée de gamme et 400G utilisent Tomahawk 4 (BCM56990, 25.6 Tbps, 64×400G) comme l'Edgecore AS9736-64D. Ce sont des commutateurs à buffer partagé on-chip, et chacun figure sur la liste de compatibilité matérielle OcNOS.

Vous concevez l'intégralité du data center IA ? Nous planifierons chaque plan avec vous.

Indiquez-nous l'échelle GPU et la charge de travail, et un ingénieur IP Infusion dimensionnera avec vous les plans back-end, stockage, front-end, gestion et DCI, ou commencez par une première ébauche d'implantation dans l'AI Fabric Design Suite.