Balanceo de carga dinámico: enrutamiento adaptativo para AI Fabrics
En una fabric de IA, use el Dynamic Load Balancing adaptativo en lugar del ECMP de hash estático. DLB reevalúa la ruta en cada flowlet, un fragmento de subflujo delimitado por un hueco entre paquetes, usando telemetría en vivo del ASIC sobre la profundidad de cola de salida y la utilización de puerto, de modo que los colectivos de GPU dejan de colisionar en un único enlace ascendente. Corre en el ASIC del switch sobre Broadcom Tomahawk 4 y 5, sin cambios en la NIC ni en la biblioteca colectiva.
Enrutamiento adaptativo sobre una fabric leaf-spine
Un segmento de cuatro spines y dos leaves transportando tráfico AllReduce de GPU. DLB mide la profundidad de cola de salida local en tiempo real. Cuando Spine-3 se satura, el leaf reasigna el siguiente flowlet a un spine menos cargado, manteniendo balanceados los cuatro enlaces ascendentes.
ECMP estático y DLB, eje por eje
El ECMP estándar aplica hash a la 5-tupla al inicio del flujo y fija el flujo durante toda su vida. En el tráfico web norte-sur, millones de flujos de corta vida suavizan la utilización entre rutas. En una fabric de IA, un puñado de flujos elefante de GPU, cada uno reteniendo un enlace ascendente 400G o 800G entero durante segundos, causa polarización de hash: algunos enlaces ascendentes se saturan mientras rutas paralelas quedan ociosas. DLB reevalúa la ruta en cada flowlet usando telemetría en vivo del ASIC.
| Axis | Static ECMPhash y fijación | DLBadaptativo, por flowlet |
|---|---|---|
| Decisión de ruta | Aplica hash a la 5-tupla una vez al inicio del flujo y fija el flujo durante toda su vida. | Reevalúa la ruta en cada frontera de flowlet y mueve el tráfico a un enlace ascendente menos congestionado. |
| Granularity | Todo el flujo. Una única elección de hash rige segundos de tráfico de flujo elefante. | Flowlet: un fragmento de subflujo delimitado por un pequeño hueco entre paquetes, seguro de reasignar sin reordenar. |
| Señal de congestión | Ninguna. El hash es ciego al estado del enlace en tiempo real. | Telemetría en vivo del ASIC sobre la profundidad de cola de salida y la utilización de puerto, recalculada cada pocos microsegundos. |
| Bajo flujos elefante de GPU | Polarización de hash: dos elefantes pueden colisionar en un enlace ascendente mientras otro queda ocioso. | Los miembros saturados salen del conjunto candidato dentro de un flowlet, de modo que los enlaces ascendentes se mantienen balanceados. |
| Riesgo de reordenamiento | Ninguno; el flujo queda fijado, pero al coste de puntos calientes y valores atípicos de latencia de cola. | Ninguno en la práctica; el hueco entre paquetes hace que RoCEv2 y TCP vean una entrega correcta en orden. |
| NIC / biblioteca colectiva | Sin cambios; comportamiento estándar. | Sin cambios. Corre en el ASIC del switch, de modo que las NIC RoCEv2 y las pilas xCCL quedan intactas. |
| Hardware | Cualquier switch con capacidad ECMP. | Broadcom Tomahawk 4 (25.6T) y Tomahawk 5 (51.2T) en configuraciones 64x400G y 64x800G. |
| Telemetría | Contadores de interfaz estándar. | Recuentos de reasignación por miembro, distribuciones de hueco de flowlet y puntuaciones de calidad de miembro sobre gNMI. |
La implementación de DLB de OcNOS
DLB no es un añadido del plano de control. Corre en el pipeline de forwarding de Broadcom, puntuando cada siguiente salto ECMP a partir de señales de congestión en vivo y reasignando flowlets en hardware, coajustado con la pila sin pérdidas de RoCEv2.
Temporizador de intervalo submilisegundo
Un temporizador de inactividad de flowlet nativo del ASIC (típicamente de 16 a 256 µs) divide los flujos elefante largos en fragmentos seguros de rociar por las rutas sin reordenar TCP o RoCEv2.
Retroalimentación en vivo de la profundidad de cola
DLB consume señales de ocupación de cola por puerto de egreso y de utilización de enlace de la canalización Tomahawk para puntuar cada siguiente salto ECMP en tiempo real.
Selección adaptativa del siguiente salto
En cada frontera de flowlet se selecciona el miembro de mayor calidad. La calidad del miembro se recalcula cada pocos microsegundos, de modo que un spine saturado sale del conjunto candidato dentro de un flowlet.
Ajustado en conjunto con PFC y ECN
DLB se integra con la pila RoCEv2 sin pérdidas (PFC, ECN/DCQCN, cálculo de holgura), de modo que la reasignación de flowlets ocurre antes de que las tramas de pausa se propaguen aguas arriba.
exportación gNMI
Los conteos de revinculación por miembro, las distribuciones de intervalo de flowlet y las puntuaciones de calidad de miembro se transmiten por gNMI dial-out para el ajuste del fabric en lazo cerrado.
TH4 / TH5 nativo
Validado sobre plataformas de spine Broadcom Tomahawk 4 (25.6T) y Tomahawk 5 (51.2T), en configuraciones de puerto 64x400G y 64x800G, sin penalización de software en el fast-path.
Dónde se sitúa DLB en la fabric
DLB es la capa de un solo salto y consciente de la congestión de un transporte Ethernet abierto mayor. Circula sobre RoCEv2 sin pérdidas, cede el relevo al GLB de toda la fabric para la puntuación extremo a extremo y mantiene un camino limpio hacia Ultra Ethernet a medida que se lanzan las NIC UEC.
Transporte sin pérdidas por debajo
DLB reasigna flowlets sobre una Tejido sin pérdidas RoCEv2 (PFC, ECN, DCQCN), de modo que el enrutamiento adaptativo y el RDMA sin pérdidas se ajustan juntos en lugar de estorbarse mutuamente.
Puntuación de toda la fabric a continuación
Donde DLB puntúa el siguiente salto local, GLB (OcNOS 7.1) extiende la decisión a la calidad de ruta extremo a extremo en toda la fabric leaf-spine.
Transporte apto para packet spray por delante
DLB es el puente de enrutamiento adaptativo hacia Ultra Ethernet, cuyo packet spray y RDMA multi-path llevan la misma idea a la NIC a medida que se lanza el hardware UEC.
Lo que ofrece DLB en fabrics de IA en producción
Al mantener los flowlets fuera de los enlaces ascendentes congestionados que el ECMP estático sobrecarga, DLB convierte una fabric leaf-spine simétrica en una que se mantiene balanceada bajo el tráfico colectivo de GPU.
- Mayor utilización. El reequilibrio de flowlets mantiene el tráfico fuera de los enlaces ascendentes congestionados que el ECMP estático sobrecarga, de modo que una fabric bien gestionada puede apuntar a una utilización superior al 90 por ciento sobre el mismo hardware, sin comprar más enlaces ascendentes.
- Menor latencia de cola. El tiempo de finalización colectiva P99.9 se ajusta porque ningún enlace individual se satura mientras otros permanecen inactivos.
- Entrenamiento más rápido. Menos tiempo de inactividad de la GPU esperando al rank más lento se traduce en una mejora medible del tiempo de ejecución en cargas de trabajo intensivas en AllReduce.
- Sin cambios de NIC. DLB vive en el ASIC del switch. Las NIC RoCEv2 existentes y las pilas colectivas xCCL (NCCL, RCCL, oneCCL) ven una entrega correcta en orden sin cambios de código.
- Una sola licencia. DLB forma parte del SKU OcNOS-DC PLUS: la misma imagen, el mismo contrato de soporte, sin complemento por función.
El enrutamiento adaptativo es requisito básico para una fabric Ethernet de IA
El ECMP estático se construyó para el tráfico web norte-sur. Una vez que una fabric transporta colectivos de GPU, el enrutamiento adaptativo es la diferencia entre enlaces ascendentes balanceados y trabajos de entrenamiento estancados, y OcNOS lo ofrece hoy sobre hardware abierto.
El ECMP por sí solo no basta
Un puñado de flujos elefante derrota al hash estático. La polarización de hash deja algunos enlaces ascendentes saturados mientras rutas paralelas quedan ociosas.
DLB cierra la brecha de enrutamiento
La selección de ruta por flowlet y consciente de la congestión mantiene balanceada una fabric Ethernet bajo el tráfico colectivo, uno de los ejes donde InfiniBand tenía ventaja.
OcNOS es el habilitador
DLB hoy, GLB a continuación, UEC a medida que se lanzan las NIC. Un solo NOS sobre hardware abierto validado de proveedores como Edgecore y UfiSpace, sin cambios en la NIC ni en la biblioteca colectiva.
Dynamic Load Balancing, respondido
¿Qué es un flowlet y por qué lo utiliza el DLB?
¿En qué se diferencia el DLB del ECMP estático?
¿Requiere DLB nuevas NIC o cambios en mi biblioteca colectiva?
¿Qué hardware admite OcNOS DLB?
Profundice. Llévelo consigo.
El datasheet del producto y descargas técnicas y breves que profundizan más que esta página.
Datasheet de OcNOS-DC
Especificación completa de OcNOS-DC: el conjunto de funciones EVPN-VXLAN y Ethernet for AI, los SKU de software, las plataformas de hardware compatibles y la guía de pedido de la solución.
Obtener el datasheetAI Fabric sin pérdidas de 800G con OcNOS
Fabric RoCEv2 sin bloqueo sobre spines Broadcom Tomahawk 4/5: niveles de SKU, plataformas validadas y arquitectura de despliegue.
Obtener el briefFabric DC EVPN-VXLAN
Fabric de centro de datos leaf-spine de nivel operador: IRB simétrico, rutas Type-2/Type-5 y gateway anycast distribuido.
Obtener el briefDatasheet de OcNOS-DC
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
AI Fabric sin pérdidas de 800G con OcNOS
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Fabric DC EVPN-VXLAN
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
¿Ajustando DLB para su fabric de GPU? Obtenga una revisión específica de su carga de trabajo
Díganos la escala de GPU y el patrón colectivo, y un ingeniero de IP Infusion ajustará los temporizadores de flowlet y la puntuación de rutas con usted, o empiece con un primer trazado leaf-spine en el AI Fabric Design Suite.
Diseñe toda la fabric de IA con OcNOS
Desde el caso de negocio hasta los cálculos de recuento de puertos, retome donde esté en la construcción.