Definición de redes · 800G · RoCEv2

¿Qué es un switch de red para IA?

Un switch de red para IA es un switch Ethernet de centro de datos de alto radix, normalmente de 400G u 800G por puerto, que conecta los servidores GPU en la fabric de back-end de IA y mantiene el tráfico RDMA sin pérdidas con PFC, ECN y balanceo de carga adaptativo, porque el flujo más lento determina cuánto dura un trabajo de entrenamiento. IP Infusion desarrolla OcNOS-DC, el sistema operativo de red que hace funcionar estos switches, y lo suministra como sistemas completos y validados sobre plataformas Broadcom Tomahawk 5 de 51.2 Tbps y plataformas de 25.6 y 12.8 Tbps.

51,2 TbpsPlataformas Tomahawk 5
800G64 puertos por switch
RoCEv2transporte Ethernet sin pérdidas
40+plataformas validadas
Definición

Qué convierte un switch de centro de datos en un switch de IA

Un switch merece la etiqueta de IA cuando transporta el tráfico de GPU a la velocidad, la escala y la tasa de pérdida que necesita un clúster de entrenamiento. Cinco propiedades lo distinguen. La red que forman estos switches se trata en Qué es una fabric de IA; esta página trata del switch en sí.

  • Velocidad de puerto y capacidad. Las NIC de GPU se conectan a 400G y 800G, y el puerto del switch tiene que igualarlas. Un switch de 51.2 Tbps ofrece 64 puertos a 800G; un switch de 25.6 Tbps ofrece 64 puertos a 400G.
  • Radix. El número de puertos por switch determina cuántas GPU puede atender un leaf y cuántos leaves puede unir un spine, lo que decide cuántos niveles necesita la fabric. Menos niveles significa menos saltos, menos óptica y menos consumo.
  • Transporte sin pérdidas. Las GPU intercambian datos con RDMA over Converged Ethernet (RoCEv2), que se ralentiza drásticamente cuando se descartan paquetes. El switch necesita Priority Flow Control (PFC) para pausar una cola antes de que se desborde y Explicit Congestion Notification (ECN) para avisar pronto a los emisores, en coordinación con el control de congestión DCQCN de la NIC.
  • Carga equilibrada. Las operaciones colectivas como AllReduce producen unos pocos flujos muy grandes. El hashing estático puede colocar dos de ellos en un mismo enlace mientras otro enlace permanece inactivo. El balanceo dinámico de carga desplaza el tráfico hacia las rutas menos cargadas.
  • Visibilidad. Telemetría por streaming informa de la profundidad de las colas, las pausas PFC y las marcas ECN en el momento en que se producen, para que los operadores puedan encontrar el enlace que ralentiza un trabajo.
Dónde se ubican

Dónde se ubican los switches de IA en una fabric de red de IA

Un centro de datos de IA opera cuatro redes en paralelo, y cada una exige algo distinto a sus switches. La fabric de back-end de GPU es lo que la mayoría entiende por switch de IA.

Fabric de back-end de GPU

Conecta las NIC de GPU entre servidores para entrenamiento e inferencia. Se construye con leaves rail-optimized y un spine Clos a 400G u 800G y funciona sin pérdidas de extremo a extremo. Es donde más importan la velocidad de puerto y el radix.

Fabric de almacenamiento

Suministra los datos de entrenamiento a los servidores GPU y escribe de vuelta los checkpoints. A menudo RoCEv2 también, dimensionada para un ancho de banda sostenido más que para el número de GPU.

Red de front-end

Conecta el clúster con los usuarios, la orquestación y el resto del centro de datos. Un leaf-spine convencional, a menudo con EVPN-VXLAN para mantener separados a los inquilinos en una nube de GPU.

Gestión out-of-band

Una red de 1G independiente para consolas, controladores de gestión de servidores y gestión de switches, de modo que los operadores puedan llegar a cada equipo cuando los planos de datos están ocupados o caídos.

Dentro de la fabric de back-end, el mismo modelo de switch puede actuar como leaf de rail, spine o super-spine. Un diseño rail-optimized conecta cada NIC de GPU de un servidor a un leaf distinto, de modo que el tráfico entre GPU del mismo rango queda a un salto. La topología define la función; Topologías de AI fabric y red rail-optimized cubren esos diseños.

Los switches de IA los compran los proveedores de neocloud y de nube de GPU, los centros de datos de grandes empresas y los MSP, y los proveedores de servicios que añaden capacidad de GPU en sus propios centros de datos.

Dimensionamiento

800G o 400G: dimensionar un switch de IA por su radix

El número de puertos del switch decide hasta dónde crece una fabric antes de necesitar otro nivel. En un leaf-spine sin bloqueo de dos niveles, cada leaf reparte sus puertos a partes iguales entre GPU y spines, y cada puerto de spine conecta un leaf. Un switch con k puertos admite entonces k al cuadrado dividido entre dos endpoints en dos niveles, y k al cubo dividido entre cuatro en tres niveles.

Capacidad de switchPuertos a velocidad completaDos niveles, sin bloqueoTres niveles, sin bloqueo
51,2 Tbps64 a 800G2,048 endpoints a 800G65,536 endpoints a 800G
25,6 Tbps64 a 400G2,048 endpoints a 400G65,536 endpoints a 400G
12,8 Tbps32 a 400G512 endpoints a 400G8,192 endpoints a 400G
  • Son límites aritméticos, no cifras de escala de producto. Los diseños reales los modifican con la sobresuscripción, los rails por servidor, el alcance de la óptica y la potencia por rack.
  • 800G con el mismo radix duplica el ancho de banda por GPU sin añadir un nivel. Por eso las fabrics de back-end construidas en torno a NIC de 800G usan switches de 51.2 Tbps.
  • Los diseños de referencia de IP Infusion para fabrics rail-optimized y Clos de 3 etapas, dimensionados con recuentos de puertos reales, están en Topologías de AI fabric. La elección entre diseños se explica en cómo elegir una fabric de red de IA.
Plataformas OcNOS

Switches de centro de datos de IA validados para OcNOS-DC

OcNOS-DC es el sistema operativo de red de IP Infusion para fabrics de centro de datos y de IA. Se ejecuta en switches abiertos construidos sobre silicio Broadcom, y cada plataforma siguiente figura en la Lista de compatibilidad de hardware de OcNOS, que abarca más de 40 plataformas validadas en total.

CapacidadASIC de BroadcomPlataformas validadasUbicación típica en un centro de datos de IA
51,2 TbpsTomahawk 5 (BCM78900)Edgecore AIS800-64D, UfiSpace S9321-64E, UfiSpace S9321-64EOLeaf y spine de back-end 800G; el S9321-64EO también transporta DCI coherente entre sitios
25,6 TbpsTomahawk 4 (BCM56990)Edgecore AS9736-64D (DCS520)Fabric de back-end, almacenamiento o front-end 400G
12,8 TbpsTomahawk 3 (BCM56980)Edgecore AS9716-32D (DCS510)Spine 400G para fabrics más pequeñas y redes de front-end
12,8 TbpsTrident 4 (BCM56880)Edgecore AS9726-32DB (DCS240), UfiSpace S9300-32DLeaf 400G para front-end y almacenamiento; compatible con IPoDWDM

Lo que OcNOS-DC aporta al switch

  • RoCEv2 sin pérdidas: PFC, incluido PFC sobre underlays enrutados de capa 3, detección y recuperación de deadlocks de PFC, ECN con ajuste de DCQCN, y DCBX y ETS para el ancho de banda por clase.
  • Balanceo de carga: Dynamic Load Balancing (DLB) para enrutamiento adaptativo basado en flowlets, y Balanceo de carga global (GLB) para la optimización de rutas en toda la fabric en OcNOS 7.1.
  • Nubes de GPU multiinquilino: EVPN-VXLAN mantiene separados a los inquilinos en una fabric compartida. En las plataformas Trident 3 X4, X5 y X7 y Trident 4, ECN y PFC over VXLAN también señalizan la congestión a través del overlay.
  • Operaciones: telemetría en streaming mediante gNMI y OpenConfig, además de NETCONF, YANG y el aprovisionamiento zero-touch.
  • Licencias y soporte de plataformas: DLB, la detección y recuperación de deadlocks de PFC y ECN over VXLAN son funciones del nivel OcNOS-DC PLUS, y su soporte varía según la plataforma. La Matriz de funciones OcNOS enumera más de 700 funciones por plataforma y nivel.
  • Red de gestión: Las plataformas 1G Trident 3 X2 (Edgecore AS4625-54T, Celestica DS1000 y UfiSpace S6301-56ST, 120 Gbps cada una) ejecutan la red fuera de banda con el mismo NOS.
Ventajas y contrapartidas

Lo que los switches de IA abiertos le aportan y lo que le exigen

Los switches abiertos con un sistema operativo de red independiente cambian dónde están las decisiones y dónde está el trabajo.

Lo que gana

  • Elección de hardware. OcNOS-DC se ejecuta en switches de más de un fabricante de hardware, de modo que cada plano puede elegirse por capacidad, óptica y plazo de entrega.
  • Un único NOS en todos los planos. Las redes de back-end, almacenamiento, front-end y gestión ejecutan un único sistema operativo, una única CLI y un único modelo de automatización.
  • Ethernet estándar. Una fabric RoCEv2 usa la misma óptica, el mismo cableado y las mismas herramientas que el resto del centro de datos, y la NIC de GPU se elige por separado del switch.
  • Una vía hacia el nuevo silicio. Pasar de 25.6 a 51.2 Tbps cambia el switch, no el modelo operativo.

Lo que le exige

  • Integración. Ethernet sin pérdidas solo funciona cuando los buffers del switch, PFC, ECN y el control de congestión de la NIC se ajustan conjuntamente. Alguien tiene que hacer ese ajuste y responder de él.
  • Modelo de soporte. Con hardware y software de empresas distintas, el operador necesita un único responsable claro cuando una falla cruza la frontera entre ambos.
  • Carga de validación. La óptica, los cables, el firmware de las NIC y las versiones del NOS cambian cada uno con el tiempo, y cada combinación necesita pruebas antes de producción.

OcNOS Systems resuelven estos tres puntos suministrando el switch y OcNOS-DC como un sistema completo y validado, listo para desplegar, con las combinaciones de plataformas y funciones compatibles publicadas en la Lista de compatibilidad de hardware y la Matriz de funciones.

Comparar

Tres formas de comprar switches de centro de datos de IA

El silicio del switch suele ser el mismo en todas las opciones. Lo que difiere es quién elige el software, quién integra las piezas y quién asume las pruebas.

PreguntaSwitch y NOS integrados de un solo fabricanteSwitch abierto autointegradoSistema abierto validado
Elección de hardwareLos modelos propios del fabricanteCualquier switch abierto que elija el compradorSwitches abiertos de la HCL de OcNOS
Sistema operativo de redLigado al hardwareElegido e instalado por el compradorOcNOS-DC, validado en esa plataforma
Quién integra y pruebaEl fabricanteEl compradorIP Infusion valida la combinación de plataforma y NOS
Elección de la NIC de GPUVaría según el fabricanteCualquier NIC que admita RoCEv2Cualquier NIC que admita RoCEv2
Dónde está el esfuerzoBajo esfuerzo de integración, elección más limitadaMayor esfuerzo de integración, elección más ampliaIntegración realizada de antemano, elección dentro de la HCL
Pasar a un nuevo silicioCuando el fabricante lo lanzaCuando el comprador lo ha validadoCuando la plataforma se añade a la HCL

Preguntas frecuentes sobre switches de red para IA

¿Qué es un switch de IA?
Un switch de IA es un switch Ethernet de centro de datos diseñado para la fabric de back-end de GPU. Ofrece puertos de 400G u 800G con alto radix, admite RoCEv2 sin pérdidas con PFC y ECN, y reparte los flujos grandes por todas las rutas, porque el flujo más lento determina cuánto dura un trabajo de entrenamiento. El término describe para qué se usa el switch y qué admite, no una clase de hardware distinta.
¿Cuál es el mejor switch para IA?
El switch adecuado depende del número de GPU, la velocidad de la NIC y cuántos niveles de fabric acepte. Para NIC de 800G, un switch de 51.2 Tbps con 64 puertos a 800G tiene un límite aritmético de 2,048 endpoints en una fabric sin bloqueo de dos niveles. Para NIC de 400G, un switch de 25.6 Tbps ofrece el mismo radix a 400G. Más allá de la velocidad de puerto, compruebe el soporte de PFC y ECN, el balanceo dinámico de carga, la telemetría en streaming y si el sistema operativo de red está validado en ese hardware.
¿Necesito switches de 800G para IA o basta con 400G?
Ajuste el switch a la NIC. Los clústeres con NIC de 400G se cubren con switches de 25.6 o 12.8 Tbps. Los clústeres construidos en torno a NIC de 800G necesitan puertos de switch de 800G, o cada GPU obtiene la mitad de su ancho de banda de red, lo que en la práctica significa un switch de 51.2 Tbps. Con el mismo radix, 800G duplica el ancho de banda por GPU sin añadir un nivel de fabric.
¿Qué es un switch de fabric de GPU?
Es otro nombre del switch de IA en la red de back-end de GPU: los switches leaf, spine o super-spine que conectan las NIC de GPU entre servidores. Dentro de un servidor o rack, las GPU también se comunican mediante una interconexión de escalado vertical independiente. El switch de fabric de GPU transporta el tráfico de escalado horizontal entre servidores.
¿Necesitan los switches de IA buffers profundos?
Normalmente no en la fabric de back-end. La mayoría de las fabrics de back-end de IA usan switches de alto radix con buffers compartidos en el chip y se apoyan en PFC, ECN y el balanceo de carga para evitar pérdidas. Los switches de buffer profundo son más habituales en el borde de la red, como la interconexión de centros de datos y los routers de proveedores de servicios, donde el tráfico llega por enlaces largos o de velocidades desiguales.
¿Puede una fabric de red de IA usar Ethernet en lugar de InfiniBand?
Sí. RoCEv2 transporta RDMA sobre Ethernet estándar, y con PFC, ECN y balanceo de carga una fabric Ethernet funciona sin pérdidas para el tráfico de GPU. Ethernet también permite que un único equipo de operaciones, un único conjunto de óptica y un único conjunto de herramientas cubran las redes de back-end y de front-end.
¿Qué switches admite OcNOS para fabrics de IA?
Para la fabric de back-end de GPU, OcNOS-DC se ejecuta en switches Broadcom Tomahawk 5 de 51.2 Tbps (Edgecore AIS800-64D, UfiSpace S9321-64E y UfiSpace S9321-64EO) y en un switch Tomahawk 4 de 25.6 Tbps (Edgecore AS9736-64D). OcNOS-DC también está validado en switches Tomahawk 3 y Trident 4 de 12.8 Tbps (Edgecore AS9716-32D, Edgecore AS9726-32DB y UfiSpace S9300-32D). La lista completa de más de 40 plataformas validadas está en la Lista de compatibilidad de hardware de OcNOS.
Relacionado

Siga leyendo sobre fabrics de IA y open networking

¿Qué es una AI fabric?

La red de back-end de GPU que construyen estos switches.

Arquitectura de fabric de IA

Cada plano de un centro de datos de IA y su hardware.

OcNOS AI Fabric

La fabric de IA 800G completa sobre OcNOS-DC.

InfiniBand frente a Ethernet

Los dos transportes comparados para IA.

¿Qué es un switch white box?

El modelo de hardware abierto detrás de los switches de IA.

¿Qué es un sistema operativo de red?

El software que convierte el silicio en una fabric.

¿Qué es la desagregación de red?

Comprar el switch y su software por separado.

Redes abiertas

Hardware abierto, software abierto y el lugar de IP Infusion.

¿Qué es Ethernet sin pérdidas?

PFC, ECN y DCQCN, y cómo evitan las pérdidas.

¿Elige switches para un clúster de GPU? Parta del número de GPU.

Indíquenos el número de GPU, la velocidad de la NIC y la sobresuscripción que puede aceptar. Un ingeniero de IP Infusion dimensionará las etapas de leaf, spine y super-spine sobre switches validados con OcNOS-DC.