Balanceo de carga dinámico: enrutamiento adaptativo para AI Fabrics
El ECMP de hash estático se construyó para el tráfico web norte-sur, no para los colectivos de GPU. El Dynamic Load Balancing (DLB) de OcNOS reasigna los flowlets a rutas menos congestionadas en intervalos de menos de un milisegundo, cerrando la brecha entre Ethernet e InfiniBand para las cargas de trabajo de entrenamiento distribuido.
Enrutamiento adaptativo en un fabric Leaf-Spine
Una porción de 4 spines y 2 leafs que transporta tráfico de GPU AllReduce. DLB mide la profundidad de la cola de egreso local en tiempo real. Cuando el Spine-3 se satura, el leaf revincula el siguiente flowlet al Spine-2, manteniendo equilibrados los cuatro uplinks.
Por qué el ECMP estático falla en los tejidos de IA
El ECMP estándar elige un puerto de salida aplicando un hash a la 5-tupla al inicio del flujo y fija ese flujo allí durante toda su vida útil. En el tráfico web norte-sur, con millones de flujos de corta duración, la ley de los grandes números uniformiza la utilización entre las rutas. En un fabric de IA, usted tiene un número reducido de flujos elefante de los colectivos de GPU (AllReduce, AllGather, All-to-All) que consumen cada uno un enlace ascendente completo de 400G o 800G durante segundos a la vez. Dos elefantes con hash sobre el mismo enlace ascendente colisionarán durante toda la operación, mientras otro enlace ascendente permanece inactivo.
The result is hash polarisation: measured fabric utilisation around 50-60% with random hot-spots, and tail-latency outliers that stall the entire training job. DLB closes this gap by re-evaluating the path decision on every flowlet, a sub-flow chunk delimited by a small inter-packet gap, using live egress queue-depth and port-utilisation telemetry from the ASIC. To size a leaf-spine fabric for your GPU cluster, use the Herramienta de dimensionamiento de AI Fabric.
La implementación de DLB de OcNOS
Temporizador de intervalo submilisegundo
ASIC-native flowlet inactivity timer (typical 16-256 µs) splits long elephant flows into chunks safe to spray across paths without TCP/RoCEv2 reordering.
Retroalimentación en vivo de la profundidad de cola
DLB consume señales de ocupación de cola por puerto de egreso y de utilización de enlace de la canalización Tomahawk para puntuar cada siguiente salto ECMP en tiempo real.
Selección adaptativa del siguiente salto
En el límite del flowlet, se selecciona el miembro de mayor calidad. La calidad de los miembros se recalcula cada pocos microsegundos, de modo que un spine saturado queda fuera del conjunto de candidatos en un solo flowlet.
Ajustado en conjunto con PFC y ECN
DLB se integra con la pila RoCEv2 sin pérdidas (PFC, ECN/DCQCN, cálculo de holgura), de modo que la reasignación de flowlets ocurre antes de que las tramas de pausa se propaguen aguas arriba.
exportación gNMI
Los conteos de revinculación por miembro, las distribuciones de intervalo de flowlet y las puntuaciones de calidad de miembro se transmiten por gNMI dial-out para el ajuste del fabric en lazo cerrado.
TH4 / TH5 nativo
Validado en plataformas spine Broadcom Tomahawk 4 (25.6T) y Tomahawk 5 (51.2T), en configuraciones de puertos 64×400G y 64×800G, sin penalización de software en el fast-path.
Lo que ofrece DLB en fabrics de IA en producción
- Mayor utilización. Los benchmarks de reequilibrio de flowlets publicados por la industria llevan la utilización de la fabric desde ~55% con ECMP estático hacia más del 90% en el mismo hardware, sin comprar más uplinks.
- Menor latencia de cola. El tiempo de finalización colectiva P99.9 se ajusta porque ningún enlace individual se satura mientras otros permanecen inactivos.
- Entrenamiento más rápido. Menos tiempo de inactividad de la GPU esperando al rank más lento se traduce en una mejora medible del tiempo de ejecución en cargas de trabajo intensivas en AllReduce.
- Sin cambios de NIC. El DLB reside en el ASIC del conmutador. Los NIC RoCEv2 existentes y las pilas de colectivos xCCL (NCCL / RCCL / oneCCL) ven entrega en orden correcta sin cambios de código.
- Una sola licencia. DLB forma parte del SKU OcNOS-DC PLUS: la misma imagen, el mismo contrato de soporte, sin complemento por función.
¿Está ajustando DLB para su fabric de GPU?
Solicite una demostración técnica →Preguntas frecuentes
¿Qué es un flowlet y por qué lo utiliza el DLB?
¿En qué se diferencia el DLB del ECMP estático?
¿Requiere DLB nuevas NIC o cambios en mi biblioteca colectiva?
¿Qué hardware admite OcNOS DLB?
Profundice. Llévelo consigo.
Dos descargas técnicas y concisas que profundizan más que esta página: la arquitectura de fabric de IA 800G sin pérdidas y la referencia de data center EVPN-VXLAN.
AI Fabric sin pérdidas de 800G con OcNOS
Fabric RoCEv2 sin bloqueo sobre spines Broadcom Tomahawk 4/5: niveles de SKU, plataformas validadas y arquitectura de despliegue.
Obtener el briefFabric DC EVPN-VXLAN
Fabric de data center leaf-spine de nivel operador: IRB simétrico, rutas Type-2/Type-5 y gateway anycast distribuido.
Obtener el briefAI Fabric sin pérdidas de 800G con OcNOS
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Solution_Brief-OcNOS_800G_Ethernet-Based_Lossless_AI_Fabric.pdfFabric DC EVPN-VXLAN
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
OcNOS-modernize-your-data-center-EVPN-VxLAN_Solution-Brief.pdfDesign the whole AI fabric with OcNOS
From the business case to the port-count maths, pick up wherever you are in the build.