Rail-optimized · Clos de 3 etapas · DCI coherente

Topologías de AI Fabric: diseños optimizados por rail y programados

Ajuste la topología al recuento de GPU: un pod leaf-spine rail-optimized de hasta cerca de 1.000 GPU, un Clos de 3 etapas hasta 16.000+ y DCI coherente para abarcar sitios. Elija el diseño sin bloqueo más pequeño que mantenga saturado el enlace de cada GPU durante los colectivos. Los tres corren sobre OcNOS-DC en una fabric L3 RoCEv2 sin pérdidas (PFC + ECN), dimensionados aquí en recuentos de puertos concretos sobre Broadcom Tomahawk 4 y Tomahawk 5.

256 to 16k+GPU, un solo sistema de diseño
1:1plano de GPU sin bloqueo
hasta 800Gleaf y spine TH5
1 imageOcNOS-DC, cada nivel
Elija por la cantidad de GPU, no por la palabra de moda

El diseño sin bloqueo más pequeño que se ajusta a su recuento de GPU

Una topología de fabric de IA tiene un solo trabajo: mantener saturado el enlace de salida de cada GPU durante un colectivo sin crear valores atípicos de latencia de cola. La topología correcta es la más pequeña que logra esto para su recuento de GPU, con una ruta de reserva para el siguiente tamaño. Cuatro puntos de referencia, con cálculos de puertos concretos sobre silicio Broadcom Tomahawk.

Una imagen, cada nivel de escala
256 GPUs
Pod no bloqueante de entrada
Una fila de racks de leaves alineados por rail sobre una pequeña capa spine. Clos plegado de dos niveles, no bloqueante 1:1.
8 leaves · 4 spines · TH4 · 400G
1,024 GPUs
Pod de dos niveles optimizado por rail
Leaves alineados por rail con un spine no bloqueante 1:1. El AllReduce intra-rail permanece en el leaf; el tráfico entre rails utiliza el spine. La unidad escalable estándar de pod único.
32 leaves · 16 spines · TH5 · 800G
4,096 GPUs
Clos de 3 etapas
Leaf, spine, super-spine. Cada pod de 1.024 GPU es sin bloqueo 1:1; un plano de super-spine escala entre pods. DLB en cada nivel; GLB extremo a extremo en el tren OcNOS 7.1.
128 leaves · 64 spines · 32 super-spines · TH5 · 800G
16,384 GPUs
Clos de 3 etapas a escala
Clos de 3 etapas multipod con un plano super-spine. Dimensionado para la clase de entrenamiento de un billón de parámetros.
512 leaves · 256 spines · 128 super-spines · TH5 · 800G

El techo del leaf-spine de dos niveles es de unas 2.048 GPU a un puerto de fabric 800G por GPU; más allá, añada el nivel super-spine. La misma imagen de OcNOS-DC corre en cada nivel, de modo que la fabric escala horizontalmente con el clúster en lugar de rediseñarse en cada paso.

¿Está dimensionando su propio cluster? The AI Fabric Design Suite da un primer corte rápido: dimensiona un pod leaf-spine de dos niveles sin bloqueo asumiendo una NIC de fabric por GPU, y avisa cuando cruza a la escala de tres niveles. Los diseños de referencia siguientes usan las mismas cuentas leaf/spine sin bloqueo y las extienden a un Clos de 3 etapas a escala, de modo que los recuentos de switches coinciden con la herramienta. Rail-optimized aquí es la disciplina de cableado de un servidor GPU de 8 NIC (un rail por leaf, de modo que el AllReduce intra-rail se queda en el leaf) superpuesta sobre esa fabric sin bloqueo: cambia la localidad del tráfico, no el recuento de switches. Use la herramienta para una estimación; use estos diseños para la construcción.

Tres diseños de referencia

Rail-optimized, Clos programado y DCI coherente

OcNOS-DC se entrega frente a tres topologías de referencia que cubren fabrics de IA de un solo pod, de varios pods y de varios sitios. Cada una es una construcción concreta, dimensionada sobre hardware Broadcom listado en la HCL, no un boceto de pizarra.

Diseño de referencia 1

Pod único rail-optimized

De cada servidor GPU, sus 8 NIC aterrizan en 8 rail leaves dedicados, de modo que el AllReduce del mismo rail se queda en un leaf y nunca atraviesa el spine. Un spine sin bloqueo transporta los flujos entre rails. La unidad escalable de pod único, de hasta cerca de 1.000 GPU.

Diseño de referencia 2

Clos programado de 3 etapas

Los niveles de leaf, spine y super-spine escalan de 4.096 a 16.384 GPU. Sin bloqueo dentro de cada pod, con el plano de super-spine fijando la relación entre pods. DLB en cada salto, GLB extremo a extremo en el tren OcNOS 7.1.

Diseño de referencia 3

DCI coherente multi-DC

Cuando un entrenamiento abarca salas de datos, extienda la fabric con óptica coherente 400G ZR / ZR+ en el spine. DCI sin transpondedor entre sitios, con el Clos de 3 etapas dentro del sitio sin cambios.

Diseño de referencia 1

Pod único rail-optimized

Cada servidor GPU tiene 8 NIC, una por rail (un canal colectivo xCCL (NCCL / RCCL / oneCCL) dedicado). Cada rail es su propio leaf dedicado, de modo que las 8 NIC de cada servidor aterrizan en un leaf distinto. El AllReduce a través del rail-N se queda dentro del leaf-N, de modo que no hay presión este-oeste sobre el spine para el patrón colectivo dominante.

Rail-optimized AI fabric topology: four 800G Tomahawk 5 spines above eight rail leaves, with four GPU servers each mapping one of its eight NICs to a different rail leaf, so intra-rail AllReduce stays on one leaf.
Rail-optimized single pod: each GPU server's 8 NICs map one per rail to 8 dedicated leaves, so same-rail AllReduce stays on the leaf and only cross-rail traffic reaches the spine.

Componentes de OcNOS: Underlay L3 BGP-unnumbered, RoCEv2 sin pérdidas (PFC + ECN) en cada leaf, DLB en el nivel de spine. Construido sobre hardware listado en la HCL: la unidad escalable 800G usa leaves y spines TH5 64x800G (Edgecore AIS800-64D o UfiSpace S9321-64E); el pod de entrada de 256 GPU usa Edgecore AS9736-64D (TH4, 64x400G).

Diseño de referencia 2

Fabric programada Clos de 3 etapas: de 4.096 a 16.384 GPU

Rail-optimized deja de escalar en algún punto entre 1k y 2k GPU: se agota la radix del leaf, o el nivel de spine queda demasiado sobresuscrito. Por encima de eso, la mayoría de las fabrics de IA modernas pasan a un Clos de 3 etapas: leaf, spine, super-spine. Dos GPU cualesquiera están a lo sumo a cuatro saltos de switch; los pares del mismo leaf y del mismo pod están más cerca.

La parte difícil en un Clos es repartir los flujos de forma pareja para que ningún enlace se convierta en un punto caliente. Los enfoques van del ECMP por flujo, pasando por el balanceo de carga adaptativo (dinámico), hasta el packet spray por paquete, el modelo que usa Ultra Ethernet con el reordenamiento gestionado en la NIC. Una familia aparte, las fabrics programadas basadas en celdas como Broadcom DDC, segmenta el tráfico en celdas y lo programa dentro de la fabric. OcNOS mantiene el plano de GPU balanceado con DLB hoy y añade GLB en toda la fabric en el tren 7.1, y está listo para UEC a medida que llegan las NIC UEC.

El diagrama es esquemático: dibuja un recuento de niveles reducido. La construcción de 4.096 GPU es de 128 leaves / 64 spines / 32 super-spines sobre TH5 800G.

Three-stage Clos AI fabric topology: a super-spine tier over a spine tier over leaf switches feeding GPU pods, sized to 4,096 GPUs on 800G Tomahawk 5 with DLB at every hop.
Clos programado de 3 etapas: los niveles de leaf, spine y super-spine escalan un plano de GPU sin bloqueo hasta miles de GPU, con DLB en cada salto y GLB en toda la fabric en el tren OcNOS 7.1.

Componentes de OcNOS: Underlay L3 eBGP-unnumbered, RoCEv2 sin pérdidas (PFC + ECN), DLB en cada nivel, GLB extremo a extremo en el tren OcNOS 7.1 y telemetría de streaming gNMI hacia su stack de observabilidad. Construido sobre chasis TH5 64x800G listados en la HCL en toda la fabric.

La suscripción es un dial, no una regla fija. Estos recuentos hacen que cada pod de 1.024 GPU sea sin bloqueo 1:1 y usan un super-spine de coste optimizado ~2:1 para el tráfico entre pods, el enfoque rail-optimized en el que se apoyan las fabrics Ethernet a hiperescala (los diseños publicados a gran escala sobresuscriben el nivel superior mucho más, porque el tráfico colectivo se queda local al pod). ¿Quiere en cambio la máxima holgura any-to-any? Una construcción totalmente sin bloqueo 1:1 es de 128 / 128 / 64 con 4.096 GPU y de 512 / 512 / 256 con 16.384; solo cambian los recuentos de spine y super-spine. Modele cualquiera de las dos en el AI Fabric Design Suite.

Diseño de referencia 3

Fabric de IA multi-DC: DCI coherente

Cuando un único entrenamiento abarca más de una sala de datos, cada vez más común para modelos de billones de parámetros, la fabric se extiende por la WAN. OcNOS-DC soporta óptica coherente 400G ZR / ZR+ directamente en el spine para DCI sin transpondedor entre sitios. El Clos de 3 etapas subyacente en cada sitio no cambia.

Multi-data-center AI fabric topology: two leaf-spine sites joined by 400G ZR and ZR+ coherent optics on the spine, extending the fabric across the WAN, no external transponders.
DCI coherente multi-DC: dos centros de datos de IA unidos por óptica 400G ZR y ZR+ en el spine, extendiendo la fabric entre sitios sin transpondedores externos.

Componentes de OcNOS: Óptica coherente enchufable 400G ZR/ZR+ en un puerto de spine o border-leaf con capacidad DWDM, con telemetría gNMI entre sitios. No se requieren transpondedores externos. Alcance: 400ZR hasta unos 120 km amplificado; OpenZR+ llega más lejos con oFEC.

Guía de diseño

Reglas prácticas de diseño

Un puñado de reglas mantiene una fabric de IA del lado correcto de la curva de rendimiento y coste, sea cual sea el diseño de referencia del que parta.

  • Ajuste la topología a la cantidad de GPU. Pods más pequeños (por debajo del radix de NIC de un solo leaf): rail-only es suficiente. Escala de un solo pod: leaf-spine optimizado por rail. Multipod: el Clos de 3 etapas es el único diseño que escala sin compromisos de sobresuscripción.
  • Siempre suscripción 1:1 en el plano de IA. Los racks de almacenamiento y CPU pueden operar con mayores ratios de sobresuscripción. El plano de GPU no debería.
  • Planifique el número de rails a partir de xCCL, no de la conveniencia del cableado. 8 rails es el estándar de facto actual para servidores GPU de 8 NIC. No combine rails en menos leaves.
  • Elija el silicio por potencia y densidad, no por la marca. TH4 (25,6T) y TH5 (51,2T) son los caballos de batalla; la elección entre ellos depende del consumo del rack y del costo del cable de breakout.
  • Planifique para GLB / UEC desde el diseño. Construya el plano de telemetría desde el primer día, incluso en un fabric 7.0, de modo que la actualización a OcNOS 7.1 GLB sea puramente un paso de software. Consulte GLB and Ultra Ethernet.
  • Valide contra la HCL. Cada referencia aquí está construida sobre hardware listado en el Lista de compatibilidad de hardware de OcNOS; elija a partir de ahí para obtener soporte de primer nivel.
Preguntas frecuentes

Preguntas frecuentes sobre topología de fabric de IA

¿Qué es una topología rail-optimized y en qué se diferencia de rail-only?
Rail-optimized wiring connects each of a GPU server's 8 NICs to its own dedicated rail leaf, so the dominant same-rail AllReduce traffic stays on one leaf and never traverses the spine. Rail-only es el caso de clúster pequeño: una única fila de rack de leaves alineados por rail sin nivel de spine, donde el tráfico entre rails se apoya en el dominio de escalado vertical de la GPU. Rail-optimized añade un spine sin bloqueo para que los flujos entre rails tengan una ruta de red.
¿A cuántas GPU puede escalar un Clos de 3 etapas?
Depende de cómo se mapee cada puerto 800G a las GPU. En switches Tomahawk 5 de radix-64, un leaf-spine de 2 niveles alcanza unas 2.048 GPU a un puerto de fabric 800G por GPU (sin bloqueo 1:1), y escala hacia 8.000+ GPU cuando los puertos 800G se desglosan en varias NIC de GPU. Un Clos de 3 etapas con un nivel super-spine lo extiende a 16.000+ GPU en los diseños de referencia anteriores, y hasta unas 65.000 GPU en el límite teórico de fat-tree. Como la mayoría del tráfico colectivo se queda local al rail, el plano de super-spine se dimensiona a la relación entre pods que realmente necesita.
¿Debo usar Tomahawk 4 o Tomahawk 5?
Ambos corren OcNOS-DC. Tomahawk 4 (25.6 Tbps, 64×400G) es la opción de coste optimizado para pods de entrada y NIC de GPU 400G. Tomahawk 5 (51.2 Tbps, 64×800G) es el caballo de batalla para servidores GPU 800G y fabrics más grandes. Tomahawk 4 no tiene 800G nativo, así que ajuste el switch a la velocidad de su NIC.
¿Necesito InfiniBand, o basta con Ethernet?
Ethernet es ahora un transporte de fabric de IA de primera clase. RoCEv2 con PFC y ECN ofrece RDMA sin pérdidas hoy. Ultra Ethernet (UEC) elimina la dependencia de PFC en toda la red mediante packet spray de extremo, retransmisión selectiva y reintento a nivel de enlace a medida que se lanzan las NIC UEC. OcNOS-DC opera hoy la fabric RoCEv2 y está listo para UEC.
¿Dónde termina el escalado vertical y empieza el horizontal?
Dentro de un servidor GPU y su dominio NVLink (por ejemplo GB200 NVL72), las GPU se comunican por la fabric de escalado vertical a velocidades de terabits. La red de rail, leaf-spine y Clos es la fabric de escalado horizontal entre servidores y pods. La mayor parte del tráfico colectivo del mismo rail lo absorbe primero el escalado vertical, de modo que la red transporta el resto entre rails y entre pods, y por eso el sin bloqueo 1:1 importa sobre todo en el plano de GPU.

¿Está diseñando su AI fabric? Haremos con usted los cálculos del conteo de puertos.

Díganos la carga de trabajo y la escala de GPU, y un ingeniero de IP Infusion dimensionará los niveles de leaf, spine y super-spine con usted, o empiece con un primer trazado en el AI Fabric Design Suite.

Fabric de IA

Diseñe toda la fabric de IA con OcNOS

Desde el caso de negocio hasta los cálculos de recuento de puertos, retome donde esté en la construcción.