Topologías de AI Fabric: diseños optimizados por rail y programados

The shape of your fabric decides the shape of your training job. This page lays out the reference topologies OcNOS-DC ships against, from a rail-optimized single pod, through a scheduled 3-stage Clos, to coherent multi-DC DCI, sized in concrete port-counts on Broadcom Tomahawk 4 and Tomahawk 5 hardware.

Which AI fabric topology should you use? Pick the smallest non-blocking design that keeps every GPU's link saturated during collectives. Up to about 1,000 GPUs, use a rail-optimized leaf-spine pod (8 rails per GPU server, one rail per leaf). From roughly 1,000 to 16,000+ GPUs, move to a 3-stage Clos (leaf, spine, super-spine). To span data centers, extend with 400G ZR/ZR+ coherent DCI. All three run on OcNOS-DC over a RoCEv2 lossless (PFC + ECN) L3 fabric.

Elija por la cantidad de GPU, no por la palabra de moda

Una topología de fabric de IA tiene una sola tarea: mantener every El enlace de salida de la GPU se satura durante una operación colectiva sin generar valores atípicos de latencia de cola. La topología adecuada es la más pequeña que logra esto para su número de GPU, con un camino alternativo hacia el tamaño inmediatamente superior. A continuación: tres diseños de referencia que OcNOS-DC admite actualmente, con cálculos de puertos concretos.

¿Está dimensionando su propio cluster? The AI Fabric Design Suite ofrece una primera estimación rápida: dimensiona un dos niveles sin bloqueo pod leaf-spine suponiendo un NIC fabric por GPU, y avisa cuando se pasa a una escala de tres niveles. Los diseños de referencia siguientes utilizan el same el cálculo leaf/spine no bloqueante y su extensión a un Clos de 3 etapas a escala, de modo que el número de conmutadores coincida con la herramienta. Rail-optimized here is the wiring discipline of an 8-NIC GPU server (one rail per leaf, so intra-rail AllReduce stays on the leaf) layered on that non-blocking fabric: it changes traffic locality, not the switch count. Use the tool for a ballpark; use these designs for the build.

256GPUs

Pod no bloqueante de entrada

Una fila de racks de leaves alineados por rail sobre una pequeña capa spine. Clos plegado de dos niveles, no bloqueante 1:1.

8 leaves · 4 spines · TH4 · 400G
1,024GPUs

Pod de dos niveles optimizado por rail

Leaves alineados por rail con un spine no bloqueante 1:1. El AllReduce intra-rail permanece en el leaf; el tráfico entre rails utiliza el spine. La unidad escalable estándar de pod único.

32 leaves · 16 spines · TH5 · 800G
4,096GPUs

Clos de 3 etapas

Leaf, spine, super-spine. Each 1,024-GPU pod is 1:1 non-blocking; a super-spine plane scales across pods. DLB at every tier; GLB end-to-end on the OcNOS 7.1 train.

128 leaves · 64 spines · 32 super-spines · TH5 · 800G
16,384GPUs

Clos de 3 etapas a escala

Clos de 3 etapas multipod con un plano super-spine. Dimensionado para la clase de entrenamiento de un billón de parámetros.

512 leaves · 256 spines · 128 super-spines · TH5 · 800G
Diseño de referencia 1

Single Pod optimizado para rieles

Cada servidor GPU tiene 8 NIC, una por «rail» (un canal de colectivo xCCL (NCCL / RCCL / oneCCL) dedicado). Cada rail tiene su propio leaf dedicado, los 8 NIC de cada servidor aterrizan, por tanto, en leaves distintos. AllReduce a través del rail-N permanece dentro del leaf-N. No hay presión este-oeste sobre el spine para el patrón colectivo dominante.

AI fabric optimizado por rieles: 8 rieles, leaves alineados por rail, spine no bloqueante 1:1 (esquema) Fabric de IA optimizado por rieles. Ocho servidores GPU en la parte inferior tienen cada uno ocho NICs alineadas con ocho rail-leaves. El Rail-N de cada servidor se conecta al leaf-N. Un nivel de spine por encima de los leaves transporta el tráfico entre rieles. El tráfico dominante de AllReduce permanece dentro de un riel, sin atravesar nunca el spine. Spine-1TH5 · 800G Spine-2TH5 · 800G Spine-3TH5 · 800G Spine-4TH5 · 800G Rail-1leaf Rail-2leaf Rail-3leaf Rail-4leaf Rail-5leaf Rail-6leaf Rail-7leaf Rail-8leaf GPU Server 1 8 × NIC · 8 rieles GPU Server 2 8 × NIC · 8 rieles GPU Server 3 8 × NIC · 8 rieles GPU Server 4 8 × NIC · 8 rieles RAIL-OPTIMIZED · 8 RAILS · INTRA-RAIL ALLREDUCE STAYS LOCAL

Componentes de OcNOS: BGP-unnumbered L3 underlay, RoCEv2 lossless (PFC + ECN) on every leaf, DLB at the spine tier. Built on HCL-listed hardware: the 800G scalable unit uses TH5 64×800G leaves and spines (Edgecore AIS800-64D or UfiSpace S9321-64E); the entry 256-GPU pod uses Edgecore AS9736-64D (TH4, 64×400G).

Programada frente a alineada por rieles: qué cambia a escala

Rail-optimized stops scaling somewhere between 1k and 2k GPUs: you run out of leaf radix, or the spine tier becomes too oversubscribed. Above that, most modern AI fabrics move to a 3-stage Clos: leaf, spine, super-spine. The hard part on a Clos is spreading flows evenly so no link becomes a hot spot. Approaches run from per-flow ECMP, through adaptive (dynamic) load balancing, to per-packet spray, the model Ultra Ethernet uses with reordering handled at the NIC. A separate family, cell-based scheduled fabrics such as Broadcom DDC, segments traffic into cells and schedules it inside the fabric. OcNOS keeps the GPU plane balanced with DLB today and adds fabric-wide GLB on the 7.1 train, and is UEC-ready as UEC NICs arrive.

Diseño de referencia 2

3-Stage Clos Scheduled Fabric: 4,096-16,384 GPUs

Three tiers: leaf, spine, super-spine. Any two GPUs are at most four switch hops apart; same-leaf and same-pod peers are closer. Non-blocking within a pod, with the super-spine plane setting the cross-pod ratio. DLB at every hop, GLB across the full path on the OcNOS 7.1 train, UEC packet-spray on UEC-capable NICs. The diagram is schematic: it draws a reduced tier count; the 4,096-GPU build is 128 leaves / 64 spines / 32 super-spines on TH5 800G.

Topología programada de fabric de IA Clos de 3 etapas Topología Clos de tres etapas. El nivel superior muestra cuatro switches super-spine. El nivel intermedio muestra ocho switches spine. El nivel inferior muestra 12 switches leaf que alimentan pods de GPU. Enlaces de malla completa de leaf a spine y de spine a super-spine. Etiquetas de la banda inferior: fabric programada de 4096 GPU, DLB en cada nivel, GLB de extremo a extremo con OcNOS 7.1. Super-Spine-1 Super-Spine-2 Super-Spine-3 Super-Spine-4 Spine-1 Spine-2 Spine-3 Spine-4 Spine-5 Spine-6 Spine-7 Spine-8 L1 L2 L3 L4 L5 L6 L7 L8 L9 L10 L11 L12 SUPER-SPINE SPINE LEAF GPU PODS 128 leaves · 32 GPU/leaf · 4.096 GPU en total · TH5 · 800G CLOS DE 3 ETAPAS · 4.096 GPU · DLB EN CADA SALTO · GLB E2E (OcNOS 7.1) · LISTO PARA UEC

Componentes de OcNOS: Underlay L3 eBGP-unnumbered, RoCEv2 sin pérdidas (PFC + ECN), DLB en cada nivel, GLB de extremo a extremo en la rama OcNOS 7.1, telemetría en streaming gNMI hacia su stack de observabilidad; overlay multi-tenant EVPN-VXLAN donde se requiere multitenencia. Construido sobre chasis TH5 de 64×800G listados en la HCL en todo el recorrido.

Subscription is a dial, not a fixed rule. These counts make each 1,024-GPU pod 1:1 non-blocking and use a cost-optimized ~2:1 super-spine for cross-pod traffic, the rail-optimized approach hyperscale Ethernet fabrics rely on (published large-scale designs oversubscribe the top tier far more, because collective traffic stays pod-local). Want maximal any-to-any headroom instead? A fully non-blocking 1:1 build is 128 / 128 / 64 at 4,096 GPUs and 512 / 512 / 256 at 16,384; only the spine and super-spine counts change. Model either in the AI Fabric Design Suite.

Multi-DC y DCI para entrenamiento distribuido

Cuando una sola ejecución de entrenamiento abarca más de una sala de datos, algo cada vez más común para los modelos de billones de parámetros, el fabric se extiende a través de la WAN. OcNOS-DC admite óptica coherente 400G ZR / ZR+ directamente en el spine para una DCI sin transpondedor, con extensión de túnel EVPN que transporta tenants VXLAN entre sitios.

Diseño de referencia 3

Fabric de IA multi-DC: DCI coherente

Dos centros de datos de IA unidos mediante 400G ZR/ZR+ en el spine. EVPN inter-DC transporta la extensión de inquilinos L2/L3; el Clos de 3 etapas subyacente en cada sitio permanece sin cambios.

Fabric de IA multi-DC con DCI de 400G ZR/ZR+ Dos centros de datos de IA, cada uno con una fabric leaf-spine. Los dos spines se conectan a través de ópticas coherentes 400G ZR/ZR+ a lo largo de una WAN. Los túneles EVPN inter-DC extienden los tenants de un sitio al otro. Banda inferior: DCI coherente sin transpondedores. DATA CENTER A DATA CENTER B Spine-A1400G ZR+ Spine-A2400G ZR+ Spine-B1400G ZR+ Spine-B2400G ZR+ EVPN inter-DC · 400G ZR/ZR+ Leaf-A1 Leaf-A2 Leaf-A3 Leaf-B1 Leaf-B2 Leaf-B3 Pods de GPU · Sitio A Pods de GPU · Sitio B DCI COHERENTE · SIN TRANSPONDEDOR · EVPN INTER-DC · 400G ZR/ZR+

Componentes de OcNOS: 400G ZR/ZR+ pluggable coherent optics on a DWDM-capable spine or border-leaf port, EVPN inter-DC for tenant L2/L3 extension, gNMI telemetry across sites. No external transponders required. Reach: 400ZR to roughly 120 km amplified; OpenZR+ reaches farther on oFEC.

Reglas prácticas de diseño

  • Ajuste la topología a la cantidad de GPU. Pods más pequeños (por debajo del radix de NIC de un solo leaf): rail-only es suficiente. Escala de un solo pod: leaf-spine optimizado por rail. Multipod: el Clos de 3 etapas es el único diseño que escala sin compromisos de sobresuscripción.
  • Siempre suscripción 1:1 en el plano de IA. Los racks de almacenamiento y CPU pueden operar con mayores ratios de sobresuscripción. El plano de GPU no debería.
  • Planifique el número de rails a partir de xCCL, no de la conveniencia del cableado. 8 rieles es el estándar de facto actual para servidores de GPU con 8 NIC. No combine rieles en menos leaves.
  • Elija el silicio por potencia y densidad, no por la marca. TH4 (25,6T) y TH5 (51,2T) son los caballos de batalla; la elección entre ellos depende del consumo del rack y del costo del cable de breakout.
  • Planifique para GLB / UEC desde el diseño. Construya el plano de telemetría desde el primer día, incluso en un fabric 7.0, de modo que la actualización a OcNOS 7.1 GLB sea puramente un paso de software. Consulte GLB and Ultra Ethernet.
  • Valide contra la HCL. Cada referencia aquí está construida sobre hardware listado en el Lista de compatibilidad de hardware de OcNOS; elija a partir de ahí para obtener soporte de primer nivel.
FAQ

AI fabric topology FAQ

What is a rail-optimized topology, and how is it different from rail-only?
Rail-optimized wiring connects each of a GPU server's 8 NICs to its own dedicated rail leaf, so the dominant same-rail AllReduce traffic stays on one leaf and never traverses the spine. Rail-only is the small-cluster case: a single rack-row of rail-aligned leaves with no spine tier, where cross-rail traffic relies on the GPU scale-up domain. Rail-optimized adds a non-blocking spine so cross-rail flows have a network path.
How many GPUs can a 3-stage Clos scale to?
On radix-64 switches (Tomahawk 5 at 800G) a 2-tier leaf-spine tops out at 2,048 GPUs. A 3-stage Clos with a super-spine tier extends that to 16,000+ GPUs in the reference designs above, and up to about 65,000 GPUs at the theoretical fat-tree limit. Because most collective traffic stays rail-local, the super-spine plane is sized to the cross-pod ratio you actually need.
Should I use Tomahawk 4 or Tomahawk 5?
Both run OcNOS-DC. Tomahawk 4 (25.6 Tbps, 64×400G) is the cost-optimized choice for entry pods and 400G GPU NICs. Tomahawk 5 (51.2 Tbps, 64×800G) is the workhorse for 800G GPU servers and larger fabrics. Tomahawk 4 has no native 800G, so match the switch to your NIC speed.
Do I need InfiniBand, or is Ethernet enough?
Ethernet is now a first-class AI-fabric transport. RoCEv2 with PFC and ECN delivers lossless RDMA today. Ultra Ethernet (UEC) removes the network-wide PFC dependency using endpoint packet-spray, selective retransmission, and link-level retry as UEC NICs ship. OcNOS-DC runs the RoCEv2 fabric today and is UEC-ready.
Where does scale-up end and scale-out begin?
Inside a GPU server and its NVLink domain (for example GB200 NVL72), GPUs communicate over the scale-up fabric at terabit speeds. The rail, leaf-spine, and Clos network is the scale-out fabric between servers and pods. Most same-rail collective traffic is absorbed by scale-up first, so the network carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking matters most on the GPU plane.

¿Está diseñando su AI fabric? Haremos con usted los cálculos del conteo de puertos.

Reserve una revisión de arquitectura →
Fabric de IA

Design the whole AI fabric with OcNOS

From the business case to the port-count maths, pick up wherever you are in the build.