Topologías de AI Fabric: diseños optimizados por rail y programados
Ajuste la topología al recuento de GPU: un pod leaf-spine rail-optimized de hasta cerca de 1.000 GPU, un Clos de 3 etapas hasta 16.000+ y DCI coherente para abarcar sitios. Elija el diseño sin bloqueo más pequeño que mantenga saturado el enlace de cada GPU durante los colectivos. Los tres corren sobre OcNOS-DC en una fabric L3 RoCEv2 sin pérdidas (PFC + ECN), dimensionados aquí en recuentos de puertos concretos sobre Broadcom Tomahawk 4 y Tomahawk 5.
El diseño sin bloqueo más pequeño que se ajusta a su recuento de GPU
Una topología de fabric de IA tiene un solo trabajo: mantener saturado el enlace de salida de cada GPU durante un colectivo sin crear valores atípicos de latencia de cola. La topología correcta es la más pequeña que logra esto para su recuento de GPU, con una ruta de reserva para el siguiente tamaño. Cuatro puntos de referencia, con cálculos de puertos concretos sobre silicio Broadcom Tomahawk.
El techo del leaf-spine de dos niveles es de unas 2.048 GPU a un puerto de fabric 800G por GPU; más allá, añada el nivel super-spine. La misma imagen de OcNOS-DC corre en cada nivel, de modo que la fabric escala horizontalmente con el clúster en lugar de rediseñarse en cada paso.
¿Está dimensionando su propio cluster? The AI Fabric Design Suite da un primer corte rápido: dimensiona un pod leaf-spine de dos niveles sin bloqueo asumiendo una NIC de fabric por GPU, y avisa cuando cruza a la escala de tres niveles. Los diseños de referencia siguientes usan las mismas cuentas leaf/spine sin bloqueo y las extienden a un Clos de 3 etapas a escala, de modo que los recuentos de switches coinciden con la herramienta. Rail-optimized aquí es la disciplina de cableado de un servidor GPU de 8 NIC (un rail por leaf, de modo que el AllReduce intra-rail se queda en el leaf) superpuesta sobre esa fabric sin bloqueo: cambia la localidad del tráfico, no el recuento de switches. Use la herramienta para una estimación; use estos diseños para la construcción.
Rail-optimized, Clos programado y DCI coherente
OcNOS-DC se entrega frente a tres topologías de referencia que cubren fabrics de IA de un solo pod, de varios pods y de varios sitios. Cada una es una construcción concreta, dimensionada sobre hardware Broadcom listado en la HCL, no un boceto de pizarra.
Pod único rail-optimized
De cada servidor GPU, sus 8 NIC aterrizan en 8 rail leaves dedicados, de modo que el AllReduce del mismo rail se queda en un leaf y nunca atraviesa el spine. Un spine sin bloqueo transporta los flujos entre rails. La unidad escalable de pod único, de hasta cerca de 1.000 GPU.
Clos programado de 3 etapas
Los niveles de leaf, spine y super-spine escalan de 4.096 a 16.384 GPU. Sin bloqueo dentro de cada pod, con el plano de super-spine fijando la relación entre pods. DLB en cada salto, GLB extremo a extremo en el tren OcNOS 7.1.
DCI coherente multi-DC
Cuando un entrenamiento abarca salas de datos, extienda la fabric con óptica coherente 400G ZR / ZR+ en el spine. DCI sin transpondedor entre sitios, con el Clos de 3 etapas dentro del sitio sin cambios.
Pod único rail-optimized
Cada servidor GPU tiene 8 NIC, una por rail (un canal colectivo xCCL (NCCL / RCCL / oneCCL) dedicado). Cada rail es su propio leaf dedicado, de modo que las 8 NIC de cada servidor aterrizan en un leaf distinto. El AllReduce a través del rail-N se queda dentro del leaf-N, de modo que no hay presión este-oeste sobre el spine para el patrón colectivo dominante.

Componentes de OcNOS: Underlay L3 BGP-unnumbered, RoCEv2 sin pérdidas (PFC + ECN) en cada leaf, DLB en el nivel de spine. Construido sobre hardware listado en la HCL: la unidad escalable 800G usa leaves y spines TH5 64x800G (Edgecore AIS800-64D o UfiSpace S9321-64E); el pod de entrada de 256 GPU usa Edgecore AS9736-64D (TH4, 64x400G).
Fabric programada Clos de 3 etapas: de 4.096 a 16.384 GPU
Rail-optimized deja de escalar en algún punto entre 1k y 2k GPU: se agota la radix del leaf, o el nivel de spine queda demasiado sobresuscrito. Por encima de eso, la mayoría de las fabrics de IA modernas pasan a un Clos de 3 etapas: leaf, spine, super-spine. Dos GPU cualesquiera están a lo sumo a cuatro saltos de switch; los pares del mismo leaf y del mismo pod están más cerca.
La parte difícil en un Clos es repartir los flujos de forma pareja para que ningún enlace se convierta en un punto caliente. Los enfoques van del ECMP por flujo, pasando por el balanceo de carga adaptativo (dinámico), hasta el packet spray por paquete, el modelo que usa Ultra Ethernet con el reordenamiento gestionado en la NIC. Una familia aparte, las fabrics programadas basadas en celdas como Broadcom DDC, segmenta el tráfico en celdas y lo programa dentro de la fabric. OcNOS mantiene el plano de GPU balanceado con DLB hoy y añade GLB en toda la fabric en el tren 7.1, y está listo para UEC a medida que llegan las NIC UEC.
El diagrama es esquemático: dibuja un recuento de niveles reducido. La construcción de 4.096 GPU es de 128 leaves / 64 spines / 32 super-spines sobre TH5 800G.

Componentes de OcNOS: Underlay L3 eBGP-unnumbered, RoCEv2 sin pérdidas (PFC + ECN), DLB en cada nivel, GLB extremo a extremo en el tren OcNOS 7.1 y telemetría de streaming gNMI hacia su stack de observabilidad. Construido sobre chasis TH5 64x800G listados en la HCL en toda la fabric.
La suscripción es un dial, no una regla fija. Estos recuentos hacen que cada pod de 1.024 GPU sea sin bloqueo 1:1 y usan un super-spine de coste optimizado ~2:1 para el tráfico entre pods, el enfoque rail-optimized en el que se apoyan las fabrics Ethernet a hiperescala (los diseños publicados a gran escala sobresuscriben el nivel superior mucho más, porque el tráfico colectivo se queda local al pod). ¿Quiere en cambio la máxima holgura any-to-any? Una construcción totalmente sin bloqueo 1:1 es de 128 / 128 / 64 con 4.096 GPU y de 512 / 512 / 256 con 16.384; solo cambian los recuentos de spine y super-spine. Modele cualquiera de las dos en el AI Fabric Design Suite.
Fabric de IA multi-DC: DCI coherente
Cuando un único entrenamiento abarca más de una sala de datos, cada vez más común para modelos de billones de parámetros, la fabric se extiende por la WAN. OcNOS-DC soporta óptica coherente 400G ZR / ZR+ directamente en el spine para DCI sin transpondedor entre sitios. El Clos de 3 etapas subyacente en cada sitio no cambia.

Componentes de OcNOS: Óptica coherente enchufable 400G ZR/ZR+ en un puerto de spine o border-leaf con capacidad DWDM, con telemetría gNMI entre sitios. No se requieren transpondedores externos. Alcance: 400ZR hasta unos 120 km amplificado; OpenZR+ llega más lejos con oFEC.
Reglas prácticas de diseño
Un puñado de reglas mantiene una fabric de IA del lado correcto de la curva de rendimiento y coste, sea cual sea el diseño de referencia del que parta.
- Ajuste la topología a la cantidad de GPU. Pods más pequeños (por debajo del radix de NIC de un solo leaf): rail-only es suficiente. Escala de un solo pod: leaf-spine optimizado por rail. Multipod: el Clos de 3 etapas es el único diseño que escala sin compromisos de sobresuscripción.
- Siempre suscripción 1:1 en el plano de IA. Los racks de almacenamiento y CPU pueden operar con mayores ratios de sobresuscripción. El plano de GPU no debería.
- Planifique el número de rails a partir de xCCL, no de la conveniencia del cableado. 8 rails es el estándar de facto actual para servidores GPU de 8 NIC. No combine rails en menos leaves.
- Elija el silicio por potencia y densidad, no por la marca. TH4 (25,6T) y TH5 (51,2T) son los caballos de batalla; la elección entre ellos depende del consumo del rack y del costo del cable de breakout.
- Planifique para GLB / UEC desde el diseño. Construya el plano de telemetría desde el primer día, incluso en un fabric 7.0, de modo que la actualización a OcNOS 7.1 GLB sea puramente un paso de software. Consulte GLB and Ultra Ethernet.
- Valide contra la HCL. Cada referencia aquí está construida sobre hardware listado en el Lista de compatibilidad de hardware de OcNOS; elija a partir de ahí para obtener soporte de primer nivel.
Preguntas frecuentes sobre topología de fabric de IA
¿Qué es una topología rail-optimized y en qué se diferencia de rail-only?
¿A cuántas GPU puede escalar un Clos de 3 etapas?
¿Debo usar Tomahawk 4 o Tomahawk 5?
¿Necesito InfiniBand, o basta con Ethernet?
¿Dónde termina el escalado vertical y empieza el horizontal?
Profundice. Llévelo consigo.
El datasheet del producto y descargas técnicas y breves que profundizan más que esta página.
Datasheet de OcNOS-DC
Especificación completa de OcNOS-DC: el conjunto de funciones EVPN-VXLAN y Ethernet for AI, los SKU de software, las plataformas de hardware compatibles y la guía de pedido de la solución.
Obtener el datasheetAI Fabric sin pérdidas de 800G con OcNOS
Fabric RoCEv2 sin bloqueo sobre spines Broadcom Tomahawk 4/5: niveles de SKU, plataformas validadas y arquitectura de despliegue.
Obtener el briefFabric DC EVPN-VXLAN
Fabric de centro de datos leaf-spine de nivel operador: IRB simétrico, rutas Type-2/Type-5 y gateway anycast distribuido.
Obtener el briefDatasheet de OcNOS-DC
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
AI Fabric sin pérdidas de 800G con OcNOS
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Fabric DC EVPN-VXLAN
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
¿Está diseñando su AI fabric? Haremos con usted los cálculos del conteo de puertos.
Díganos la carga de trabajo y la escala de GPU, y un ingeniero de IP Infusion dimensionará los niveles de leaf, spine y super-spine con usted, o empiece con un primer trazado en el AI Fabric Design Suite.
Diseñe toda la fabric de IA con OcNOS
Desde el caso de negocio hasta los cálculos de recuento de puertos, retome donde esté en la construcción.