Back-end IA · Storage · Front-end · Coherent DCI

Architettura della fabric per data center IA

Un data center IA esegue quattro piani di rete, non una singola rete piatta: una fabric back-end IA per i collettivi GPU-to-GPU, una fabric di storage, una fabric front-end e un piano di gestione out-of-band isolato. Il Coherent DCI estende il training tra più siti, e OcNOS-DC esegue ogni piano su un unico NOS tramite hardware Broadcom Tomahawk validato.

4 planespiù coherent DCI
1 NOSOcNOS-DC su ogni piano
fino a 800GTomahawk 5, 64x800G
1 contractun solo TAC, un solo SLA
Ambito per piano

Progettate i piani, non solo gli switch

La maggior parte degli errori nelle fabric IA sono errori di definizione dell'ambito: i team dimensionano il piano GPU, poi vi agganciano storage, accesso dei tenant e gestione come un ripensamento.

Separate invece il traffico per piano, e date a ciascuno il rapporto di sottoscrizione e l'isolamento di cui ha bisogno. Solo la fabric back-end IA deve essere non-blocking e lossless; le altre tre esistono per tenerle lontano il traffico che non le appartiene. Tutti e quattro i piani, più i link coerenti che uniscono i siti, funzionano su OcNOS-DC on HCL-listed hardware Tomahawk.

Le quattro fabric

Ogni piano ha un compito

Dimensionate ogni piano per il proprio compito, mantenete il suo traffico sui propri cavi, e la fabric resta prevedibile durante un'intera esecuzione di training.

Plane 1

Fabric back-end IA

Il piano GPU-to-GPU che trasporta i collettivi. Costruito 1:1 non-blocking come pod leaf-spine rail-optimized o Clos a 3 stadi su un underlay eBGP puro di Layer 3, e mantenuto lossless con la fabric RoCEv2 che RDMA richiede: PFC (anche su L3, con DCBX/LLDP) ed ECN. DLB distribuisce i flussi così che nessun link diventi un punto critico durante l'AllReduce.

1:1 non-blocking · RoCEv2 (PFC + ECN) · DLB · TH5 800G
Plane 2

Fabric di storage

Un Clos leaf-spine che sposta checkpoint e dataset tra i rack GPU e lo storage NVMe-oF o NFS. Tipicamente dimensionato intorno a 3:1, poiché i burst di storage tollerano più oversubscription rispetto ai collettivi, e mantenuto lossless così che il traffico di storage RDMA non venga scartato sotto carico.

Leaf-spine Clos · ~3:1 · lossless RDMA · NVMe-oF / NFS
Plane 3

Fabric front-end

Il piano nord-sud per l'accesso dei tenant, il servizio di inferenza e il percorso verso il resto del data center e Internet. Opera con accesso a 400G o 800G, dimensionato in base al traffico di servizio che trasporta anziché al pattern collettivo del piano back-end.

Nord-sud · tenant / inferenza · 400G / 800G
Plane 4

Gestione out-of-band

Un piano Clos o MLAG separato, con un proprio cablaggio, in modo che l'avvio e il monitoraggio non condividano mai il destino dei piani dati. Trasporta ZTP, SNMP e syslog, oltre alla telemetria in streaming gNMI/OpenConfig, e continua a funzionare mentre un fabric del piano dati viene riconfigurato.

Piano isolato · ZTP · SNMP / syslog · telemetria gNMI
Architettura di riferimento

Quattro fabric più il DCI, su un unico NOS

Un data center, quattro piani, esteso a un secondo sito tramite ottica coerente. Il piano back-end IA è non bloccante 1:1; storage, front-end e gestione operano ciascuno al rapporto richiesto dal proprio traffico. Ogni piano esegue OcNOS-DC, e il collegamento DCI ZR+ scala l'addestramento tra i siti senza transponder esterni.

AI data center fabric architecture: four planes plus coherent DCI to a second site A single AI data center shown as four stacked network planes: an AI back-end fabric (1:1 non-blocking, RoCEv2 lossless, DLB), a storage fabric (roughly 3:1, NVMe-oF and NFS), a front-end fabric (400G and 800G north-south), and an isolated out-of-band management plane (ZTP, SNMP, syslog, gNMI telemetry). All four planes run OcNOS-DC. A 400G/800G ZR+ coherent DCI link on the UfiSpace S9321-64EO connects the site to a second data center, with multi-DC training reach commonly under about 30 km on ZR+ and longer on OpenZR+. Bottom band: one NOS across AI back-end, storage, front-end, out-of-band management, and coherent DCI. DATA CENTER A · OcNOS-DC Fabric back-end IA GPU collectives · rail-optimized / Clos 1:1 non-blocking · RoCEv2 · DLB Fabric di storage checkpoints / datasets · lossless RDMA ~3:1 · NVMe-oF / NFS Fabric front-end north-south · tenant / inference 400G / 800G Out-of-band mgmt ZTP · SNMP / syslog · telemetry isolated plane · gNMI DATA CENTER B Fabric back-end IA 1:1 non-blocking · RoCEv2 Storage + front-end ~3:1 · 400G / 800G Out-of-band mgmt ZR+ DCI 400G / 800G ZR+ COHERENT · S9321-64EO · UNDER ~30 KM ZR+ · OPENZR+ FARTHER (oFEC) ONE NOS · OcNOS-DC · AI BACK-END · STORAGE · FRONT-END · OOB · COHERENT DCI

Componenti OcNOS: un underlay eBGP-unnumbered instradato per ciascun piano (il back-end IA è puro Layer 3 eBGP, con EVPN-VXLAN mantenuto come overlay dei tenant anziché come underlay IA), RoCEv2 lossless (PFC + ECN, PFC su L3 con DCBX/LLDP) e DLB sui piani back-end e storage, un piano di gestione isolato per ZTP e telemetria gNMI, e ottica coerente ZR+ a 400G/800G sull'S9321-64EO per il DCI. Costruito su hardware Tomahawk 5 presente nella HCL (Edgecore AIS800-64D, UfiSpace S9321-64E / 64EO) e Tomahawk 4 (Edgecore AS9736-64D).

Scalare tra i siti

DCI coerente, senza transponder esterni

Quando un singolo processo di addestramento supera la capacità di una data hall, il fabric si estende attraverso la WAN su ottica coerente pluggable ZR+ a 400G e 800G, direttamente da una porta di bordo.

The UfiSpace S9321-64EO è la piattaforma Tomahawk 5 che aggiunge ottica coerente ZR+ a 400G per il DCI. La portata è generalmente inferiore a circa 30 km su ZR+, e maggiore su OpenZR+ con oFEC: sufficiente a mantenere la latenza collettiva entro il budget, lasciando invariato il fabric leaf-spine di ciascun sito. Consulta l'approfondimento sul DCI coerente per i dettagli su ottica e portata.

The silicon

Quale hardware esegue ciascun piano

Ogni piano esegue OcNOS-DC su silicio Broadcom Tomahawk. I piani a 800G e il DCI utilizzano Tomahawk 5; i piani entry e a 400G utilizzano Tomahawk 4. Entrambi sono switch con buffer condiviso on-chip, e ogni piattaforma è presente nella Hardware Compatibility List di OcNOS.

Livello silicio Tomahawk 5Piani a 800G + DCI Tomahawk 4piani entry + a 400G
Componente BroadcomBCM78900BCM56990
Capacità dello switch51,2 Tbps25.6 Tbps
Configurazione delle porte64×800G64×400G
BufferBuffer condiviso on-chip; presente nella HCL.Buffer condiviso on-chip; presente nella HCL.
PiattaformeEdgecore AIS800-64D, UfiSpace S9321-64E. L'S9321-64EO aggiunge ottica coerente ZR+ a 400G per il DCI.Edgecore AS9736-64D.
Ruolo nel designPiani back-end IA e storage a 800G, più il DCI coerente tra i siti.Build entry e piani front-end o di gestione a 400G.
Un NOS, quattro ruoli

La forza di un unico NOS

I quattro piani e i collegamenti DCI non sono quattro prodotti. Sono un unico sistema operativo in quattro ruoli: OcNOS-DC esegue i fabric back-end IA, storage, front-end e di gestione out-of-band, oltre al DCI coerente, con un unico modello di configurazione e un unico stack di telemetria su gNMI e OpenConfig. Il team impara una sola CLI, una sola superficie di automazione e un solo set di contatori per ogni piano.

Un unico modello operativo

Lo stesso modello di routing, QoS e telemetria si applica sia che una porta sia un leaf back-end rivolto alle GPU, un leaf di storage, un bordo front-end o uno switch di gestione.

Un unico contratto di supporto

Un unico contratto IP Infusion copre il software e l'hardware validato, con un solo TAC e un solo SLA su ogni piano. Nessuno scaricabarile tra un fornitore di NOS e un fornitore di hardware.

Un unico elenco hardware

Ogni piano è costruito a partire dalla stessa Hardware Compatibility List di OcNOS, così supporto, ottica e firmware restano coerenti in tutto il design.

Un'unica roadmap in cui crescere

Nella roadmap: GLB esteso all'intero fabric (OcNOS 7.1), ECN basato sulla latenza (7.1.0), e LLR, CBFS e packet trimming. Il prossimo silicio Tomahawk 6 (BCM78910 / BCM78914, 102,4 Tbps, TSMC 3nm) segue il ciclo OcNOS 7.2 ed estende lo stesso design a una radix superiore. Costruisci il piano di telemetria fin dal primo giorno, così questi elementi arriveranno come semplici passaggi software.

FAQ

FAQ sull'architettura del fabric IA

Quali fabric compongono un data center IA?
Un data center IA esegue quattro piani di rete. Il Fabric back-end IA trasporta il traffico collettivo GPU-a-GPU ed è quello che deve essere non bloccante e lossless. Il fabric di storage sposta checkpoint e dataset da e verso i rack GPU tramite RDMA. Il fabric front-end gestisce l'accesso nord-sud, dei tenant e di inferenza. Un piano separato di gestione out-of-band avvia gli switch e trasmette in streaming la telemetria su un proprio cablaggio. Il DCI coerente estende il design tra i siti. OcNOS-DC esegue tutti e quattro i piani più il DCI.
Quale oversubscription dovrebbe usare ciascun fabric?
Il fabric back-end IA dovrebbe essere 1:1 non-blocking sul piano GPU, perché un collegamento sovraccarico lì blocca l'intero collettivo e ogni GPU attende il trasferimento più lento. Il fabric di storage opera in genere con un rapporto ottimizzato in termini di costo vicino a 3:1, poiché i burst di storage sono meno critici in termini di latenza rispetto ai collettivi. I piani front-end e di gestione out-of-band trasportano traffico più leggero e meno soggetto a burst, e tollerano un'oversubscription maggiore. Adatta il rapporto al traffico che ciascun piano trasporta effettivamente.
Come si collegano due data center IA?
Usa il DCI coerente: ottica pluggable ZR+ a 400G e 800G su una porta di bordo, senza transponder esterni. Su OcNOS-DC l' UfiSpace S9321-64EO aggiunge ottica coerente ZR+ a 400G esattamente per questo. La portata dell'addestramento multi-DC è generalmente inferiore a circa 30 km su ZR+, e maggiore su OpenZR+ con oFEC. Questo consente a un singolo processo di addestramento di estendersi su più di una data hall, lasciando invariato il fabric leaf-spine di ciascun sito.
Un unico NOS può eseguire tutti i fabric?
Yes. OcNOS-DC esegue i piani back-end IA, storage, front-end e di gestione out-of-band, oltre al DCI coerente, sullo stesso sistema operativo. Ciò significa un unico modello di configurazione, un unico stack di telemetria su gNMI e OpenConfig, e un unico contratto di supporto IP Infusion che copre il software e l'hardware validato, con un solo TAC e un solo SLA su ogni piano del design.
Quale hardware esegue ciascun piano?
Tutti e quattro i piani eseguono OcNOS-DC su silicio Broadcom Tomahawk. I piani a 800G utilizzano Tomahawk 5 (BCM78900, 51,2 Tbps, 64×800G): Edgecore AIS800-64D o UfiSpace S9321-64E, con l'S9321-64EO che aggiunge ottica coerente ZR+ a 400G per il DCI. I piani entry e a 400G utilizzano Tomahawk 4 (BCM56990, 25,6 Tbps, 64×400G) come l'Edgecore AS9736-64D. Sono switch con buffer condiviso on-chip, e ognuno è presente nella Hardware Compatibility List di OcNOS.

Stai progettando l'intero data center IA? Pianificheremo ogni piano insieme a te.

Indicaci la scala GPU e il workload, e un ingegnere IP Infusion dimensionerà con te i piani back-end, storage, front-end, di gestione e DCI, oppure inizia con un layout di prima approssimazione nell'AI Fabric Design Suite.