Enrutamiento adaptativo · Flowlet · RoCEv2

Balanceo de carga dinámico: enrutamiento adaptativo para AI Fabrics

En una fabric de IA, use el Dynamic Load Balancing adaptativo en lugar del ECMP de hash estático. DLB reevalúa la ruta en cada flowlet, un fragmento de subflujo delimitado por un hueco entre paquetes, usando telemetría en vivo del ASIC sobre la profundidad de cola de salida y la utilización de puerto, de modo que los colectivos de GPU dejan de colisionar en un único enlace ascendente. Corre en el ASIC del switch sobre Broadcom Tomahawk 4 y 5, sin cambios en la NIC ni en la biblioteca colectiva.

Per-flowletselección de ruta adaptativa
TH4 + TH5Broadcom Tomahawk 25.6T / 51.2T
0 cambios en la NICcorre en el ASIC del switch
1 SKUOcNOS-DC PLUS, sin complemento
Enrutamiento adaptativo en movimiento

Enrutamiento adaptativo sobre una fabric leaf-spine

Un segmento de cuatro spines y dos leaves transportando tráfico AllReduce de GPU. DLB mide la profundidad de cola de salida local en tiempo real. Cuando Spine-3 se satura, el leaf reasigna el siguiente flowlet a un spine menos cargado, manteniendo balanceados los cuatro enlaces ascendentes.

Balanceo de carga dinámico en un fabric de AI leaf-spine A four-spine, two-leaf AI fabric. GPU servers attached to the leaves send AllReduce flows. Three spine paths carry balanced flowlets. The fourth spine is congested, and Dynamic Load Balancing re-bins the next flowlet onto a less-loaded spine. Bottom band labels DLB metrics: queue depth, port utilisation, flowlet rebind. Spine-3 congested · next flowlet re-bound to Spine-2 Spine-1 cola 18% Spine-2 cola 22% Spine-3 cola 92% Spine-4 cola 25% Leaf-1 DLB · flowlet Leaf-2 DLB · flowlet GPU-0 GPU-1 GPU-2 GPU-3 DLB · QUEUE-DEPTH FEEDBACK · FLOWLET REBIND · CONGESTION-AWARE ECMP
Por qué el ECMP estático falla en los tejidos de IA

ECMP estático y DLB, eje por eje

El ECMP estándar aplica hash a la 5-tupla al inicio del flujo y fija el flujo durante toda su vida. En el tráfico web norte-sur, millones de flujos de corta vida suavizan la utilización entre rutas. En una fabric de IA, un puñado de flujos elefante de GPU, cada uno reteniendo un enlace ascendente 400G o 800G entero durante segundos, causa polarización de hash: algunos enlaces ascendentes se saturan mientras rutas paralelas quedan ociosas. DLB reevalúa la ruta en cada flowlet usando telemetría en vivo del ASIC.

Axis Static ECMPhash y fijación DLBadaptativo, por flowlet
Decisión de rutaAplica hash a la 5-tupla una vez al inicio del flujo y fija el flujo durante toda su vida.Reevalúa la ruta en cada frontera de flowlet y mueve el tráfico a un enlace ascendente menos congestionado.
GranularityTodo el flujo. Una única elección de hash rige segundos de tráfico de flujo elefante.Flowlet: un fragmento de subflujo delimitado por un pequeño hueco entre paquetes, seguro de reasignar sin reordenar.
Señal de congestiónNinguna. El hash es ciego al estado del enlace en tiempo real.Telemetría en vivo del ASIC sobre la profundidad de cola de salida y la utilización de puerto, recalculada cada pocos microsegundos.
Bajo flujos elefante de GPUPolarización de hash: dos elefantes pueden colisionar en un enlace ascendente mientras otro queda ocioso.Los miembros saturados salen del conjunto candidato dentro de un flowlet, de modo que los enlaces ascendentes se mantienen balanceados.
Riesgo de reordenamientoNinguno; el flujo queda fijado, pero al coste de puntos calientes y valores atípicos de latencia de cola.Ninguno en la práctica; el hueco entre paquetes hace que RoCEv2 y TCP vean una entrega correcta en orden.
NIC / biblioteca colectivaSin cambios; comportamiento estándar.Sin cambios. Corre en el ASIC del switch, de modo que las NIC RoCEv2 y las pilas xCCL quedan intactas.
HardwareCualquier switch con capacidad ECMP.Broadcom Tomahawk 4 (25.6T) y Tomahawk 5 (51.2T) en configuraciones 64x400G y 64x800G.
TelemetríaContadores de interfaz estándar.Recuentos de reasignación por miembro, distribuciones de hueco de flowlet y puntuaciones de calidad de miembro sobre gNMI.
Dentro de la implementación

La implementación de DLB de OcNOS

DLB no es un añadido del plano de control. Corre en el pipeline de forwarding de Broadcom, puntuando cada siguiente salto ECMP a partir de señales de congestión en vivo y reasignando flowlets en hardware, coajustado con la pila sin pérdidas de RoCEv2.

Detección de flowlet

Temporizador de intervalo submilisegundo

Un temporizador de inactividad de flowlet nativo del ASIC (típicamente de 16 a 256 µs) divide los flujos elefante largos en fragmentos seguros de rociar por las rutas sin reordenar TCP o RoCEv2.

Calidad de ruta

Retroalimentación en vivo de la profundidad de cola

DLB consume señales de ocupación de cola por puerto de egreso y de utilización de enlace de la canalización Tomahawk para puntuar cada siguiente salto ECMP en tiempo real.

Re-bind

Selección adaptativa del siguiente salto

En cada frontera de flowlet se selecciona el miembro de mayor calidad. La calidad del miembro se recalcula cada pocos microsegundos, de modo que un spine saturado sale del conjunto candidato dentro de un flowlet.

Lossless

Ajustado en conjunto con PFC y ECN

DLB se integra con la pila RoCEv2 sin pérdidas (PFC, ECN/DCQCN, cálculo de holgura), de modo que la reasignación de flowlets ocurre antes de que las tramas de pausa se propaguen aguas arriba.

Telemetría

exportación gNMI

Los conteos de revinculación por miembro, las distribuciones de intervalo de flowlet y las puntuaciones de calidad de miembro se transmiten por gNMI dial-out para el ajuste del fabric en lazo cerrado.

Hardware

TH4 / TH5 nativo

Validado sobre plataformas de spine Broadcom Tomahawk 4 (25.6T) y Tomahawk 5 (51.2T), en configuraciones de puerto 64x400G y 64x800G, sin penalización de software en el fast-path.

Parte de la pila de enrutamiento adaptativo

Dónde se sitúa DLB en la fabric

DLB es la capa de un solo salto y consciente de la congestión de un transporte Ethernet abierto mayor. Circula sobre RoCEv2 sin pérdidas, cede el relevo al GLB de toda la fabric para la puntuación extremo a extremo y mantiene un camino limpio hacia Ultra Ethernet a medida que se lanzan las NIC UEC.

Transporte sin pérdidas por debajo

DLB reasigna flowlets sobre una Tejido sin pérdidas RoCEv2 (PFC, ECN, DCQCN), de modo que el enrutamiento adaptativo y el RDMA sin pérdidas se ajustan juntos en lugar de estorbarse mutuamente.

Puntuación de toda la fabric a continuación

Donde DLB puntúa el siguiente salto local, GLB (OcNOS 7.1) extiende la decisión a la calidad de ruta extremo a extremo en toda la fabric leaf-spine.

Transporte apto para packet spray por delante

DLB es el puente de enrutamiento adaptativo hacia Ultra Ethernet, cuyo packet spray y RDMA multi-path llevan la misma idea a la NIC a medida que se lanza el hardware UEC.

En producción

Lo que ofrece DLB en fabrics de IA en producción

Al mantener los flowlets fuera de los enlaces ascendentes congestionados que el ECMP estático sobrecarga, DLB convierte una fabric leaf-spine simétrica en una que se mantiene balanceada bajo el tráfico colectivo de GPU.

  • Mayor utilización. El reequilibrio de flowlets mantiene el tráfico fuera de los enlaces ascendentes congestionados que el ECMP estático sobrecarga, de modo que una fabric bien gestionada puede apuntar a una utilización superior al 90 por ciento sobre el mismo hardware, sin comprar más enlaces ascendentes.
  • Menor latencia de cola. El tiempo de finalización colectiva P99.9 se ajusta porque ningún enlace individual se satura mientras otros permanecen inactivos.
  • Entrenamiento más rápido. Menos tiempo de inactividad de la GPU esperando al rank más lento se traduce en una mejora medible del tiempo de ejecución en cargas de trabajo intensivas en AllReduce.
  • Sin cambios de NIC. DLB vive en el ASIC del switch. Las NIC RoCEv2 existentes y las pilas colectivas xCCL (NCCL, RCCL, oneCCL) ven una entrega correcta en orden sin cambios de código.
  • Una sola licencia. DLB forma parte del SKU OcNOS-DC PLUS: la misma imagen, el mismo contrato de soporte, sin complemento por función.
La perspectiva de IP Infusion

El enrutamiento adaptativo es requisito básico para una fabric Ethernet de IA

El ECMP estático se construyó para el tráfico web norte-sur. Una vez que una fabric transporta colectivos de GPU, el enrutamiento adaptativo es la diferencia entre enlaces ascendentes balanceados y trabajos de entrenamiento estancados, y OcNOS lo ofrece hoy sobre hardware abierto.

El ECMP por sí solo no basta

Un puñado de flujos elefante derrota al hash estático. La polarización de hash deja algunos enlaces ascendentes saturados mientras rutas paralelas quedan ociosas.

DLB cierra la brecha de enrutamiento

La selección de ruta por flowlet y consciente de la congestión mantiene balanceada una fabric Ethernet bajo el tráfico colectivo, uno de los ejes donde InfiniBand tenía ventaja.

OcNOS es el habilitador

DLB hoy, GLB a continuación, UEC a medida que se lanzan las NIC. Un solo NOS sobre hardware abierto validado de proveedores como Edgecore y UfiSpace, sin cambios en la NIC ni en la biblioteca colectiva.

Preguntas frecuentes

Dynamic Load Balancing, respondido

¿Qué es un flowlet y por qué lo utiliza el DLB?
Un flowlet es un fragmento de subflujo delimitado por un pequeño intervalo entre paquetes. DLB reevalúa la ruta en cada límite de flowlet en lugar de fijar un flujo completo, de modo que el tráfico se traslada a un enlace ascendente menos congestionado sin provocar reordenamiento de RoCEv2 ni de TCP.
¿En qué se diferencia el DLB del ECMP estático?
El ECMP estático aplica hash a la 5-tupla al inicio del flujo y fija el flujo durante toda su vida, de modo que dos flujos elefante de GPU pueden colisionar en un enlace ascendente mientras otro queda ocioso. Esta polarización de hash deja algunos enlaces ascendentes saturados mientras rutas paralelas quedan ociosas. DLB puntúa cada siguiente salto en tiempo real usando la profundidad de cola y la utilización de puerto en vivo, y reasigna flowlets a la mejor ruta.
¿Requiere DLB nuevas NIC o cambios en mi biblioteca colectiva?
No. DLB se ejecuta en el ASIC del conmutador, de modo que las NIC RoCEv2 existentes y las pilas colectivas xCCL (NCCL, RCCL, oneCCL) obtienen una entrega correcta y en orden, sin cambios de código.
¿Qué hardware admite OcNOS DLB?
DLB es compatible con las plataformas Broadcom Tomahawk 4 (25,6T) y Tomahawk 5 (51,2T) en configuraciones 64x400G y 64x800G, y está incluido en el SKU OcNOS-DC PLUS sin complemento por funcionalidad.

¿Ajustando DLB para su fabric de GPU? Obtenga una revisión específica de su carga de trabajo

Díganos la escala de GPU y el patrón colectivo, y un ingeniero de IP Infusion ajustará los temporizadores de flowlet y la puntuación de rutas con usted, o empiece con un primer trazado leaf-spine en el AI Fabric Design Suite.