Topologie AI Fabric: design rail-optimized e scheduled
The shape of your fabric decides the shape of your training job. This page lays out the reference topologies OcNOS-DC ships against, from a rail-optimized single pod, through a scheduled 3-stage Clos, to coherent multi-DC DCI, sized in concrete port-counts on Broadcom Tomahawk 4 and Tomahawk 5 hardware.
Scelga in base al numero di GPU, non alla buzzword
Una topologia AI fabric ha un solo compito: mantenere every Il link in uscita della GPU si satura durante un'operazione collettiva senza generare valori anomali di latenza di coda. La topologia corretta è la più piccola che ottiene questo risultato per il vostro numero di GPU, con un percorso di ripiego verso la dimensione immediatamente superiore. Di seguito: tre progetti di riferimento che OcNOS-DC supporta oggi, con calcoli di porte concreti.
State dimensionando il vostro cluster? The AI Fabric Design Suite fornisce una prima stima rapida: dimensiona un due livelli non bloccanti pod leaf-spine ipotizzando un NIC fabric per GPU, e segnala il passaggio a una scala a tre livelli. I progetti di riferimento seguenti utilizzano il same il calcolo leaf/spine non bloccante e la sua estensione a un Clos a 3 stadi su larga scala, così che il numero di switch corrisponda allo strumento. Rail-optimized here is the wiring discipline of an 8-NIC GPU server (one rail per leaf, so intra-rail AllReduce stays on the leaf) layered on that non-blocking fabric: it changes traffic locality, not the switch count. Use the tool for a ballpark; use these designs for the build.
Pod non bloccante entry-level
Una sola fila di rack di leaf rail-aligned sopra un piccolo tier spine. Clos folded a due livelli, non bloccante 1:1.
Pod a due livelli rail-optimized
Leaf rail-aligned con una spine non bloccante 1:1. L'AllReduce intra-rail rimane sul leaf; il traffico cross-rail utilizza la spine. L'unità scalabile standard a pod singolo.
Clos a 3 stadi
Leaf, spine, super-spine. Each 1,024-GPU pod is 1:1 non-blocking; a super-spine plane scales across pods. DLB at every tier; GLB end-to-end on the OcNOS 7.1 train.
Clos a 3 stadi scalato
Clos a 3 stadi multi-pod con un piano super-spine. Dimensionato per la classe di training a trilioni di parametri.
Single Pod ottimizzato per i rail
Ogni server GPU dispone di 8 NIC, una per «rail» (un canale collettivo xCCL dedicato (NCCL / RCCL / oneCCL)). Ogni rail ha il proprio leaf dedicato – di conseguenza tutte le 8 NIC di ciascun server atterrano su un leaf diverso. L'AllReduce sulla rail-N resta all'interno del leaf-N. Nessuna pressione est-ovest sullo spine per il pattern collettivo dominante.
Componenti OcNOS: BGP-unnumbered L3 underlay, RoCEv2 lossless (PFC + ECN) on every leaf, DLB at the spine tier. Built on HCL-listed hardware: the 800G scalable unit uses TH5 64×800G leaves and spines (Edgecore AIS800-64D or UfiSpace S9321-64E); the entry 256-GPU pod uses Edgecore AS9736-64D (TH4, 64×400G).
Scheduled o Rail-Aligned: cosa cambia su larga scala
Rail-optimized stops scaling somewhere between 1k and 2k GPUs: you run out of leaf radix, or the spine tier becomes too oversubscribed. Above that, most modern AI fabrics move to a 3-stage Clos: leaf, spine, super-spine. The hard part on a Clos is spreading flows evenly so no link becomes a hot spot. Approaches run from per-flow ECMP, through adaptive (dynamic) load balancing, to per-packet spray, the model Ultra Ethernet uses with reordering handled at the NIC. A separate family, cell-based scheduled fabrics such as Broadcom DDC, segments traffic into cells and schedules it inside the fabric. OcNOS keeps the GPU plane balanced with DLB today and adds fabric-wide GLB on the 7.1 train, and is UEC-ready as UEC NICs arrive.
3-Stage Clos Scheduled Fabric: 4,096-16,384 GPUs
Three tiers: leaf, spine, super-spine. Any two GPUs are at most four switch hops apart; same-leaf and same-pod peers are closer. Non-blocking within a pod, with the super-spine plane setting the cross-pod ratio. DLB at every hop, GLB across the full path on the OcNOS 7.1 train, UEC packet-spray on UEC-capable NICs. The diagram is schematic: it draws a reduced tier count; the 4,096-GPU build is 128 leaves / 64 spines / 32 super-spines on TH5 800G.
Componenti OcNOS: Underlay L3 eBGP-unnumbered, RoCEv2 lossless (PFC + ECN), DLB a ogni livello, GLB end-to-end sul ramo OcNOS 7.1, streaming telemetry gNMI verso il vostro stack di observability; overlay multi-tenant EVPN-VXLAN dove è richiesta la multi-tenancy. Costruito su chassis TH5 64×800G presenti nella HCL in tutta l'architettura.
Subscription is a dial, not a fixed rule. These counts make each 1,024-GPU pod 1:1 non-blocking and use a cost-optimized ~2:1 super-spine for cross-pod traffic, the rail-optimized approach hyperscale Ethernet fabrics rely on (published large-scale designs oversubscribe the top tier far more, because collective traffic stays pod-local). Want maximal any-to-any headroom instead? A fully non-blocking 1:1 build is 128 / 128 / 64 at 4,096 GPUs and 512 / 512 / 256 at 16,384; only the spine and super-spine counts change. Model either in the AI Fabric Design Suite.
Multi-DC e DCI per il training distribuito
Quando una singola sessione di training si estende su più data hall, situazione sempre più comune per i modelli da migliaia di miliardi di parametri, la fabric si estende attraverso la WAN. OcNOS-DC supporta ottiche coerenti 400G ZR / ZR+ direttamente sullo spine per un DCI senza transponder, con l'estensione dei tunnel EVPN che trasporta i tenant VXLAN tra i siti.
AI Fabric multi-DC: DCI coerente
Due data center AI cuciti insieme con 400G ZR/ZR+ sullo spine. L'EVPN inter-DC trasporta l'estensione tenant L2/L3; il Clos a 3 stadi sottostante in ciascun sito resta invariato.
Componenti OcNOS: 400G ZR/ZR+ pluggable coherent optics on a DWDM-capable spine or border-leaf port, EVPN inter-DC for tenant L2/L3 extension, gNMI telemetry across sites. No external transponders required. Reach: 400ZR to roughly 120 km amplified; OpenZR+ reaches farther on oFEC.
Regole pratiche di progettazione
- Adatti la topologia al numero di GPU. Pod più piccoli (sotto la radix NIC di un singolo leaf): solo rail è sufficiente. Scala a singolo pod: leaf-spine rail-optimized. Multi-pod: il Clos a 3 stadi è l'unico design che scala senza compromessi di oversubscription.
- Sempre subscription 1:1 sul piano AI. I rack di storage e CPU possono operare con rapporti di oversubscription più elevati. Il piano GPU non dovrebbe.
- Pianifichi il numero di rail a partire da xCCL, non in base alla comodità del cablaggio. 8 rail è l'attuale standard de-facto per i server GPU a 8 NIC. Non combini i rail in un numero inferiore di leaf.
- Si scelga il silicio in base a potenza e densità, non al marchio. TH4 (25,6T) e TH5 (51,2T) sono i cavalli da lavoro; la scelta tra i due è una questione di potenza rack e costo dei cavi breakout.
- Pianifichi GLB / UEC fin dalla fase di progettazione. Costruisca il telemetry plane fin dal primo giorno, anche su una fabric 7.0, così l'upgrade a OcNOS 7.1 GLB diventa un semplice passaggio software. Veda GLB e Ultra Ethernet.
- Verificare rispetto all'HCL. Ogni riferimento qui è costruito su hardware elencato nel OcNOS Hardware Compatibility List; partite da qui per un supporto di prima classe.
AI fabric topology FAQ
What is a rail-optimized topology, and how is it different from rail-only?
How many GPUs can a 3-stage Clos scale to?
Should I use Tomahawk 4 or Tomahawk 5?
Do I need InfiniBand, or is Ethernet enough?
Where does scale-up end and scale-out begin?
Sta progettando il suo AI fabric? Calcoliamo insieme il numero di porte.
Prenoti una Architecture Review →Design the whole AI fabric with OcNOS
From the business case to the port-count maths, pick up wherever you are in the build.
Approfondite. Portatelo con voi.
Due download tecnici e concisi che approfondiscono oltre questa pagina: l'architettura del fabric AI 800G lossless e il riferimento di data center EVPN-VXLAN.
OcNOS 800G Lossless AI Fabric
Fabric RoCEv2 non bloccante su spine Broadcom Tomahawk 4/5: tier di SKU, piattaforme validate e architettura di deployment.
Scarica il briefEVPN-VXLAN data center fabric
Fabric di data center leaf-spine carrier-grade: IRB simmetrico, route Type-2/Type-5 e gateway anycast distribuito.
Scarica il briefOcNOS 800G Lossless AI Fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
Solution_Brief-OcNOS_800G_Ethernet-Based_Lossless_AI_Fabric.pdfEVPN-VXLAN data center fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
OcNOS-modernize-your-data-center-EVPN-VxLAN_Solution-Brief.pdf