Topologías de AI Fabric: diseños optimizados por rail y programados
The shape of your fabric decides the shape of your training job. This page lays out the reference topologies OcNOS-DC ships against, from a rail-optimized single pod, through a scheduled 3-stage Clos, to coherent multi-DC DCI, sized in concrete port-counts on Broadcom Tomahawk 4 and Tomahawk 5 hardware.
Elija por la cantidad de GPU, no por la palabra de moda
Una topología de fabric de IA tiene una sola tarea: mantener every El enlace de salida de la GPU se satura durante una operación colectiva sin generar valores atípicos de latencia de cola. La topología adecuada es la más pequeña que logra esto para su número de GPU, con un camino alternativo hacia el tamaño inmediatamente superior. A continuación: tres diseños de referencia que OcNOS-DC admite actualmente, con cálculos de puertos concretos.
¿Está dimensionando su propio cluster? The AI Fabric Design Suite ofrece una primera estimación rápida: dimensiona un dos niveles sin bloqueo pod leaf-spine suponiendo un NIC fabric por GPU, y avisa cuando se pasa a una escala de tres niveles. Los diseños de referencia siguientes utilizan el same el cálculo leaf/spine no bloqueante y su extensión a un Clos de 3 etapas a escala, de modo que el número de conmutadores coincida con la herramienta. Rail-optimized here is the wiring discipline of an 8-NIC GPU server (one rail per leaf, so intra-rail AllReduce stays on the leaf) layered on that non-blocking fabric: it changes traffic locality, not the switch count. Use the tool for a ballpark; use these designs for the build.
Pod no bloqueante de entrada
Una fila de racks de leaves alineados por rail sobre una pequeña capa spine. Clos plegado de dos niveles, no bloqueante 1:1.
Pod de dos niveles optimizado por rail
Leaves alineados por rail con un spine no bloqueante 1:1. El AllReduce intra-rail permanece en el leaf; el tráfico entre rails utiliza el spine. La unidad escalable estándar de pod único.
Clos de 3 etapas
Leaf, spine, super-spine. Each 1,024-GPU pod is 1:1 non-blocking; a super-spine plane scales across pods. DLB at every tier; GLB end-to-end on the OcNOS 7.1 train.
Clos de 3 etapas a escala
Clos de 3 etapas multipod con un plano super-spine. Dimensionado para la clase de entrenamiento de un billón de parámetros.
Single Pod optimizado para rieles
Cada servidor GPU tiene 8 NIC, una por «rail» (un canal de colectivo xCCL (NCCL / RCCL / oneCCL) dedicado). Cada rail tiene su propio leaf dedicado, los 8 NIC de cada servidor aterrizan, por tanto, en leaves distintos. AllReduce a través del rail-N permanece dentro del leaf-N. No hay presión este-oeste sobre el spine para el patrón colectivo dominante.
Componentes de OcNOS: BGP-unnumbered L3 underlay, RoCEv2 lossless (PFC + ECN) on every leaf, DLB at the spine tier. Built on HCL-listed hardware: the 800G scalable unit uses TH5 64×800G leaves and spines (Edgecore AIS800-64D or UfiSpace S9321-64E); the entry 256-GPU pod uses Edgecore AS9736-64D (TH4, 64×400G).
Programada frente a alineada por rieles: qué cambia a escala
Rail-optimized stops scaling somewhere between 1k and 2k GPUs: you run out of leaf radix, or the spine tier becomes too oversubscribed. Above that, most modern AI fabrics move to a 3-stage Clos: leaf, spine, super-spine. The hard part on a Clos is spreading flows evenly so no link becomes a hot spot. Approaches run from per-flow ECMP, through adaptive (dynamic) load balancing, to per-packet spray, the model Ultra Ethernet uses with reordering handled at the NIC. A separate family, cell-based scheduled fabrics such as Broadcom DDC, segments traffic into cells and schedules it inside the fabric. OcNOS keeps the GPU plane balanced with DLB today and adds fabric-wide GLB on the 7.1 train, and is UEC-ready as UEC NICs arrive.
3-Stage Clos Scheduled Fabric: 4,096-16,384 GPUs
Three tiers: leaf, spine, super-spine. Any two GPUs are at most four switch hops apart; same-leaf and same-pod peers are closer. Non-blocking within a pod, with the super-spine plane setting the cross-pod ratio. DLB at every hop, GLB across the full path on the OcNOS 7.1 train, UEC packet-spray on UEC-capable NICs. The diagram is schematic: it draws a reduced tier count; the 4,096-GPU build is 128 leaves / 64 spines / 32 super-spines on TH5 800G.
Componentes de OcNOS: Underlay L3 eBGP-unnumbered, RoCEv2 sin pérdidas (PFC + ECN), DLB en cada nivel, GLB de extremo a extremo en la rama OcNOS 7.1, telemetría en streaming gNMI hacia su stack de observabilidad; overlay multi-tenant EVPN-VXLAN donde se requiere multitenencia. Construido sobre chasis TH5 de 64×800G listados en la HCL en todo el recorrido.
Subscription is a dial, not a fixed rule. These counts make each 1,024-GPU pod 1:1 non-blocking and use a cost-optimized ~2:1 super-spine for cross-pod traffic, the rail-optimized approach hyperscale Ethernet fabrics rely on (published large-scale designs oversubscribe the top tier far more, because collective traffic stays pod-local). Want maximal any-to-any headroom instead? A fully non-blocking 1:1 build is 128 / 128 / 64 at 4,096 GPUs and 512 / 512 / 256 at 16,384; only the spine and super-spine counts change. Model either in the AI Fabric Design Suite.
Multi-DC y DCI para entrenamiento distribuido
Cuando una sola ejecución de entrenamiento abarca más de una sala de datos, algo cada vez más común para los modelos de billones de parámetros, el fabric se extiende a través de la WAN. OcNOS-DC admite óptica coherente 400G ZR / ZR+ directamente en el spine para una DCI sin transpondedor, con extensión de túnel EVPN que transporta tenants VXLAN entre sitios.
Fabric de IA multi-DC: DCI coherente
Dos centros de datos de IA unidos mediante 400G ZR/ZR+ en el spine. EVPN inter-DC transporta la extensión de inquilinos L2/L3; el Clos de 3 etapas subyacente en cada sitio permanece sin cambios.
Componentes de OcNOS: 400G ZR/ZR+ pluggable coherent optics on a DWDM-capable spine or border-leaf port, EVPN inter-DC for tenant L2/L3 extension, gNMI telemetry across sites. No external transponders required. Reach: 400ZR to roughly 120 km amplified; OpenZR+ reaches farther on oFEC.
Reglas prácticas de diseño
- Ajuste la topología a la cantidad de GPU. Pods más pequeños (por debajo del radix de NIC de un solo leaf): rail-only es suficiente. Escala de un solo pod: leaf-spine optimizado por rail. Multipod: el Clos de 3 etapas es el único diseño que escala sin compromisos de sobresuscripción.
- Siempre suscripción 1:1 en el plano de IA. Los racks de almacenamiento y CPU pueden operar con mayores ratios de sobresuscripción. El plano de GPU no debería.
- Planifique el número de rails a partir de xCCL, no de la conveniencia del cableado. 8 rieles es el estándar de facto actual para servidores de GPU con 8 NIC. No combine rieles en menos leaves.
- Elija el silicio por potencia y densidad, no por la marca. TH4 (25,6T) y TH5 (51,2T) son los caballos de batalla; la elección entre ellos depende del consumo del rack y del costo del cable de breakout.
- Planifique para GLB / UEC desde el diseño. Construya el plano de telemetría desde el primer día, incluso en un fabric 7.0, de modo que la actualización a OcNOS 7.1 GLB sea puramente un paso de software. Consulte GLB and Ultra Ethernet.
- Valide contra la HCL. Cada referencia aquí está construida sobre hardware listado en el Lista de compatibilidad de hardware de OcNOS; elija a partir de ahí para obtener soporte de primer nivel.
AI fabric topology FAQ
What is a rail-optimized topology, and how is it different from rail-only?
How many GPUs can a 3-stage Clos scale to?
Should I use Tomahawk 4 or Tomahawk 5?
Do I need InfiniBand, or is Ethernet enough?
Where does scale-up end and scale-out begin?
¿Está diseñando su AI fabric? Haremos con usted los cálculos del conteo de puertos.
Reserve una revisión de arquitectura →Design the whole AI fabric with OcNOS
From the business case to the port-count maths, pick up wherever you are in the build.
Profundice. Llévelo consigo.
Dos descargas técnicas y concisas que profundizan más que esta página: la arquitectura de fabric de IA 800G sin pérdidas y la referencia de data center EVPN-VXLAN.
AI Fabric sin pérdidas de 800G con OcNOS
Fabric RoCEv2 sin bloqueo sobre spines Broadcom Tomahawk 4/5: niveles de SKU, plataformas validadas y arquitectura de despliegue.
Obtener el briefFabric DC EVPN-VXLAN
Fabric de data center leaf-spine de nivel operador: IRB simétrico, rutas Type-2/Type-5 y gateway anycast distribuido.
Obtener el briefAI Fabric sin pérdidas de 800G con OcNOS
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Solution_Brief-OcNOS_800G_Ethernet-Based_Lossless_AI_Fabric.pdfFabric DC EVPN-VXLAN
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
OcNOS-modernize-your-data-center-EVPN-VxLAN_Solution-Brief.pdf