¿Qué es un switch de red para IA?
Un switch de red para IA es un switch Ethernet de centro de datos de alto radix, normalmente de 400G u 800G por puerto, que conecta los servidores GPU en la fabric de back-end de IA y mantiene el tráfico RDMA sin pérdidas con PFC, ECN y balanceo de carga adaptativo, porque el flujo más lento determina cuánto dura un trabajo de entrenamiento. IP Infusion desarrolla OcNOS-DC, el sistema operativo de red que hace funcionar estos switches, y lo suministra como sistemas completos y validados sobre plataformas Broadcom Tomahawk 5 de 51.2 Tbps y plataformas de 25.6 y 12.8 Tbps.
Qué convierte un switch de centro de datos en un switch de IA
Un switch merece la etiqueta de IA cuando transporta el tráfico de GPU a la velocidad, la escala y la tasa de pérdida que necesita un clúster de entrenamiento. Cinco propiedades lo distinguen. La red que forman estos switches se trata en Qué es una fabric de IA; esta página trata del switch en sí.
- Velocidad de puerto y capacidad. Las NIC de GPU se conectan a 400G y 800G, y el puerto del switch tiene que igualarlas. Un switch de 51.2 Tbps ofrece 64 puertos a 800G; un switch de 25.6 Tbps ofrece 64 puertos a 400G.
- Radix. El número de puertos por switch determina cuántas GPU puede atender un leaf y cuántos leaves puede unir un spine, lo que decide cuántos niveles necesita la fabric. Menos niveles significa menos saltos, menos óptica y menos consumo.
- Transporte sin pérdidas. Las GPU intercambian datos con RDMA over Converged Ethernet (RoCEv2), que se ralentiza drásticamente cuando se descartan paquetes. El switch necesita Priority Flow Control (PFC) para pausar una cola antes de que se desborde y Explicit Congestion Notification (ECN) para avisar pronto a los emisores, en coordinación con el control de congestión DCQCN de la NIC.
- Carga equilibrada. Las operaciones colectivas como AllReduce producen unos pocos flujos muy grandes. El hashing estático puede colocar dos de ellos en un mismo enlace mientras otro enlace permanece inactivo. El balanceo dinámico de carga desplaza el tráfico hacia las rutas menos cargadas.
- Visibilidad. Telemetría por streaming informa de la profundidad de las colas, las pausas PFC y las marcas ECN en el momento en que se producen, para que los operadores puedan encontrar el enlace que ralentiza un trabajo.
Dónde se ubican los switches de IA en una fabric de red de IA
Un centro de datos de IA opera cuatro redes en paralelo, y cada una exige algo distinto a sus switches. La fabric de back-end de GPU es lo que la mayoría entiende por switch de IA.
Fabric de back-end de GPU
Conecta las NIC de GPU entre servidores para entrenamiento e inferencia. Se construye con leaves rail-optimized y un spine Clos a 400G u 800G y funciona sin pérdidas de extremo a extremo. Es donde más importan la velocidad de puerto y el radix.
Fabric de almacenamiento
Suministra los datos de entrenamiento a los servidores GPU y escribe de vuelta los checkpoints. A menudo RoCEv2 también, dimensionada para un ancho de banda sostenido más que para el número de GPU.
Red de front-end
Conecta el clúster con los usuarios, la orquestación y el resto del centro de datos. Un leaf-spine convencional, a menudo con EVPN-VXLAN para mantener separados a los inquilinos en una nube de GPU.
Gestión out-of-band
Una red de 1G independiente para consolas, controladores de gestión de servidores y gestión de switches, de modo que los operadores puedan llegar a cada equipo cuando los planos de datos están ocupados o caídos.
Dentro de la fabric de back-end, el mismo modelo de switch puede actuar como leaf de rail, spine o super-spine. Un diseño rail-optimized conecta cada NIC de GPU de un servidor a un leaf distinto, de modo que el tráfico entre GPU del mismo rango queda a un salto. La topología define la función; Topologías de AI fabric y red rail-optimized cubren esos diseños.
Los switches de IA los compran los proveedores de neocloud y de nube de GPU, los centros de datos de grandes empresas y los MSP, y los proveedores de servicios que añaden capacidad de GPU en sus propios centros de datos.
800G o 400G: dimensionar un switch de IA por su radix
El número de puertos del switch decide hasta dónde crece una fabric antes de necesitar otro nivel. En un leaf-spine sin bloqueo de dos niveles, cada leaf reparte sus puertos a partes iguales entre GPU y spines, y cada puerto de spine conecta un leaf. Un switch con k puertos admite entonces k al cuadrado dividido entre dos endpoints en dos niveles, y k al cubo dividido entre cuatro en tres niveles.
| Capacidad de switch | Puertos a velocidad completa | Dos niveles, sin bloqueo | Tres niveles, sin bloqueo |
|---|---|---|---|
| 51,2 Tbps | 64 a 800G | 2,048 endpoints a 800G | 65,536 endpoints a 800G |
| 25,6 Tbps | 64 a 400G | 2,048 endpoints a 400G | 65,536 endpoints a 400G |
| 12,8 Tbps | 32 a 400G | 512 endpoints a 400G | 8,192 endpoints a 400G |
- Son límites aritméticos, no cifras de escala de producto. Los diseños reales los modifican con la sobresuscripción, los rails por servidor, el alcance de la óptica y la potencia por rack.
- 800G con el mismo radix duplica el ancho de banda por GPU sin añadir un nivel. Por eso las fabrics de back-end construidas en torno a NIC de 800G usan switches de 51.2 Tbps.
- Los diseños de referencia de IP Infusion para fabrics rail-optimized y Clos de 3 etapas, dimensionados con recuentos de puertos reales, están en Topologías de AI fabric. La elección entre diseños se explica en cómo elegir una fabric de red de IA.
Switches de centro de datos de IA validados para OcNOS-DC
OcNOS-DC es el sistema operativo de red de IP Infusion para fabrics de centro de datos y de IA. Se ejecuta en switches abiertos construidos sobre silicio Broadcom, y cada plataforma siguiente figura en la Lista de compatibilidad de hardware de OcNOS, que abarca más de 40 plataformas validadas en total.
| Capacidad | ASIC de Broadcom | Plataformas validadas | Ubicación típica en un centro de datos de IA |
|---|---|---|---|
| 51,2 Tbps | Tomahawk 5 (BCM78900) | Edgecore AIS800-64D, UfiSpace S9321-64E, UfiSpace S9321-64EO | Leaf y spine de back-end 800G; el S9321-64EO también transporta DCI coherente entre sitios |
| 25,6 Tbps | Tomahawk 4 (BCM56990) | Edgecore AS9736-64D (DCS520) | Fabric de back-end, almacenamiento o front-end 400G |
| 12,8 Tbps | Tomahawk 3 (BCM56980) | Edgecore AS9716-32D (DCS510) | Spine 400G para fabrics más pequeñas y redes de front-end |
| 12,8 Tbps | Trident 4 (BCM56880) | Edgecore AS9726-32DB (DCS240), UfiSpace S9300-32D | Leaf 400G para front-end y almacenamiento; compatible con IPoDWDM |
Lo que OcNOS-DC aporta al switch
- RoCEv2 sin pérdidas: PFC, incluido PFC sobre underlays enrutados de capa 3, detección y recuperación de deadlocks de PFC, ECN con ajuste de DCQCN, y DCBX y ETS para el ancho de banda por clase.
- Balanceo de carga: Dynamic Load Balancing (DLB) para enrutamiento adaptativo basado en flowlets, y Balanceo de carga global (GLB) para la optimización de rutas en toda la fabric en OcNOS 7.1.
- Nubes de GPU multiinquilino: EVPN-VXLAN mantiene separados a los inquilinos en una fabric compartida. En las plataformas Trident 3 X4, X5 y X7 y Trident 4, ECN y PFC over VXLAN también señalizan la congestión a través del overlay.
- Operaciones: telemetría en streaming mediante gNMI y OpenConfig, además de NETCONF, YANG y el aprovisionamiento zero-touch.
- Licencias y soporte de plataformas: DLB, la detección y recuperación de deadlocks de PFC y ECN over VXLAN son funciones del nivel OcNOS-DC PLUS, y su soporte varía según la plataforma. La Matriz de funciones OcNOS enumera más de 700 funciones por plataforma y nivel.
- Red de gestión: Las plataformas 1G Trident 3 X2 (Edgecore AS4625-54T, Celestica DS1000 y UfiSpace S6301-56ST, 120 Gbps cada una) ejecutan la red fuera de banda con el mismo NOS.
Lo que los switches de IA abiertos le aportan y lo que le exigen
Los switches abiertos con un sistema operativo de red independiente cambian dónde están las decisiones y dónde está el trabajo.
Lo que gana
- Elección de hardware. OcNOS-DC se ejecuta en switches de más de un fabricante de hardware, de modo que cada plano puede elegirse por capacidad, óptica y plazo de entrega.
- Un único NOS en todos los planos. Las redes de back-end, almacenamiento, front-end y gestión ejecutan un único sistema operativo, una única CLI y un único modelo de automatización.
- Ethernet estándar. Una fabric RoCEv2 usa la misma óptica, el mismo cableado y las mismas herramientas que el resto del centro de datos, y la NIC de GPU se elige por separado del switch.
- Una vía hacia el nuevo silicio. Pasar de 25.6 a 51.2 Tbps cambia el switch, no el modelo operativo.
Lo que le exige
- Integración. Ethernet sin pérdidas solo funciona cuando los buffers del switch, PFC, ECN y el control de congestión de la NIC se ajustan conjuntamente. Alguien tiene que hacer ese ajuste y responder de él.
- Modelo de soporte. Con hardware y software de empresas distintas, el operador necesita un único responsable claro cuando una falla cruza la frontera entre ambos.
- Carga de validación. La óptica, los cables, el firmware de las NIC y las versiones del NOS cambian cada uno con el tiempo, y cada combinación necesita pruebas antes de producción.
OcNOS Systems resuelven estos tres puntos suministrando el switch y OcNOS-DC como un sistema completo y validado, listo para desplegar, con las combinaciones de plataformas y funciones compatibles publicadas en la Lista de compatibilidad de hardware y la Matriz de funciones.
Tres formas de comprar switches de centro de datos de IA
El silicio del switch suele ser el mismo en todas las opciones. Lo que difiere es quién elige el software, quién integra las piezas y quién asume las pruebas.
| Pregunta | Switch y NOS integrados de un solo fabricante | Switch abierto autointegrado | Sistema abierto validado |
|---|---|---|---|
| Elección de hardware | Los modelos propios del fabricante | Cualquier switch abierto que elija el comprador | Switches abiertos de la HCL de OcNOS |
| Sistema operativo de red | Ligado al hardware | Elegido e instalado por el comprador | OcNOS-DC, validado en esa plataforma |
| Quién integra y prueba | El fabricante | El comprador | IP Infusion valida la combinación de plataforma y NOS |
| Elección de la NIC de GPU | Varía según el fabricante | Cualquier NIC que admita RoCEv2 | Cualquier NIC que admita RoCEv2 |
| Dónde está el esfuerzo | Bajo esfuerzo de integración, elección más limitada | Mayor esfuerzo de integración, elección más amplia | Integración realizada de antemano, elección dentro de la HCL |
| Pasar a un nuevo silicio | Cuando el fabricante lo lanza | Cuando el comprador lo ha validado | Cuando la plataforma se añade a la HCL |
Preguntas frecuentes sobre switches de red para IA
¿Qué es un switch de IA?
¿Cuál es el mejor switch para IA?
¿Necesito switches de 800G para IA o basta con 400G?
¿Qué es un switch de fabric de GPU?
¿Necesitan los switches de IA buffers profundos?
¿Puede una fabric de red de IA usar Ethernet en lugar de InfiniBand?
¿Qué switches admite OcNOS para fabrics de IA?
Siga leyendo sobre fabrics de IA y open networking
¿Qué es una AI fabric?
La red de back-end de GPU que construyen estos switches.
Arquitectura de fabric de IA
Cada plano de un centro de datos de IA y su hardware.
¿Qué es un switch white box?
El modelo de hardware abierto detrás de los switches de IA.
¿Qué es un sistema operativo de red?
El software que convierte el silicio en una fabric.
¿Elige switches para un clúster de GPU? Parta del número de GPU.
Indíquenos el número de GPU, la velocidad de la NIC y la sobresuscripción que puede aceptar. Un ingeniero de IP Infusion dimensionará las etapas de leaf, spine y super-spine sobre switches validados con OcNOS-DC.
Profundice. Llévelo consigo.
Dos descargas breves y técnicas que van más allá de esta página: el datasheet completo de OcNOS-DC y la arquitectura de fabric de IA 800G sin pérdidas.
Datasheet de OcNOS-DC
Especificación completa de OcNOS-DC: el conjunto de funciones EVPN-VXLAN y Ethernet for AI, los SKU de software, las plataformas de hardware compatibles y la guía de pedido de la solución.
Obtener el datasheetAI Fabric sin pérdidas de 800G con OcNOS
Fabric RoCEv2 sin bloqueo sobre spines Broadcom Tomahawk 4/5: niveles de SKU, plataformas validadas y arquitectura de despliegue.
Obtener el briefDatasheet de OcNOS-DC
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
AI Fabric sin pérdidas de 800G con OcNOS
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.