Dynamic Load Balancing : routage adaptatif pour les fabrics IA
L'ECMP à hachage statique a été conçu pour le trafic web nord-sud, pas pour les collectives GPU. Le Dynamic Load Balancing (DLB) d'OcNOS redistribue les flowlets sur des chemins moins congestionnés à des intervalles inférieurs à la milliseconde, comblant l'écart entre Ethernet et InfiniBand pour les charges d'entraînement distribué.
Adaptive Routing sur une fabric Leaf-Spine
Un segment à 4 spines et 2 leafs transportant du trafic GPU AllReduce. Le DLB mesure en temps réel la profondeur de la file d'attente d'egress locale. Lorsque Spine-3 sature, le leaf réaffecte le flowlet suivant sur Spine-2, gardant les quatre uplinks équilibrés.
Pourquoi l'ECMP statique échoue sur les fabrics IA
L'ECMP standard choisit un port de sortie en hachant le 5-tuple au début du flux et y fixe le flux pendant toute sa durée de vie. Sur le trafic web nord-sud, des millions de flux éphémères, la loi des grands nombres lisse l'utilisation entre les chemins. Sur un fabric IA, vous avez un petit nombre de flux éléphants des collectifs GPU (AllReduce, AllGather, All-to-All) qui consomment chacun la totalité d'un lien montant 400G ou 800G pendant plusieurs secondes d'affilée. Deux éléphants hachés sur le même lien montant entreront en collision pendant toute la durée de l'opération, tandis qu'un autre lien montant reste inactif.
The result is hash polarisation: measured fabric utilisation around 50-60% with random hot-spots, and tail-latency outliers that stall the entire training job. DLB closes this gap by re-evaluating the path decision on every flowlet, a sub-flow chunk delimited by a small inter-packet gap, using live egress queue-depth and port-utilisation telemetry from the ASIC. To size a leaf-spine fabric for your GPU cluster, use the Outil de dimensionnement d'AI Fabric.
L'implémentation DLB d'OcNOS
Minuteur d'écart inframilliseconde
ASIC-native flowlet inactivity timer (typical 16-256 µs) splits long elephant flows into chunks safe to spray across paths without TCP/RoCEv2 reordering.
Retour en temps réel sur la profondeur des files
Le DLB exploite les signaux d'occupation des files par port de sortie et d'utilisation des liens issus du pipeline Tomahawk pour évaluer chaque next-hop ECMP en temps réel.
Sélection adaptative du next-hop
À la frontière d'un flowlet, le membre de plus haute qualité est sélectionné. La qualité des membres est recalculée toutes les quelques microsecondes, de sorte qu'un spine saturé sort de l'ensemble des candidats en l'espace d'un flowlet.
Co-réglé avec PFC et ECN
Le DLB s'intègre à la pile lossless RoCEv2 (PFC, ECN/DCQCN, calcul du headroom), de sorte que le rebinding des flowlets se produit avant que les trames de pause ne se propagent en amont.
export gNMI
Les nombres de réassociations par membre, les distributions d'écarts de flowlet et les scores de qualité des membres sont diffusés via le dial-out gNMI pour un réglage de la fabric en boucle fermée.
TH4 / TH5 natif
Validé sur les plateformes spine Broadcom Tomahawk 4 (25,6T) et Tomahawk 5 (51,2T), en configurations de ports 64×400G et 64×800G, sans pénalité logicielle sur le fast-path.
Ce que DLB apporte dans les fabrics IA en production
- Meilleure utilisation. Les benchmarks de rééquilibrage de flowlets publiés dans l'industrie font passer l'utilisation du fabric d'environ 55 % en ECMP statique à plus de 90 % sur le même matériel, sans acheter d'uplinks supplémentaires.
- Latence de queue réduite. Le temps de complétion des collectives P99.9 se resserre car aucun lien unique ne sature pendant que d'autres restent inactifs.
- Entraînement plus rapide. Moins de temps d'inactivité GPU à attendre le rang le plus lent se traduit par une amélioration mesurable du temps réel sur les charges de travail intensives en AllReduce.
- Aucune modification de NIC. Le DLB réside dans l'ASIC du commutateur. Les NIC RoCEv2 existants et les piles d'opérations collectives xCCL (NCCL / RCCL / oneCCL) existantes bénéficient d'une livraison ordonnée correcte sans modification de code.
- Une seule licence. DLB fait partie du SKU OcNOS-DC PLUS : même image, même contrat de support, sans supplément par fonctionnalité.
Vous réglez le DLB pour votre fabric GPU ?
Demander une démo technique →Questions fréquentes
Qu'est-ce qu'un flowlet et pourquoi le DLB l'utilise-t-il ?
En quoi le DLB diffère-t-il de l'ECMP statique ?
DLB nécessite-t-il de nouvelles NIC ou des modifications de ma bibliothèque collective ?
Quel matériel prend en charge OcNOS DLB ?
Approfondissez. Emportez-le avec vous.
Deux documents techniques concis qui vont plus loin que cette page : l'architecture de fabric IA 800G sans perte et la référence de data center EVPN-VXLAN.
OcNOS 800G Lossless AI Fabric
Fabric RoCEv2 non bloquante sur des spines Broadcom Tomahawk 4/5 : niveaux de SKU, plateformes validées et architecture de déploiement.
Obtenir le briefFabric DC EVPN-VXLAN
Fabric de data center leaf-spine de niveau opérateur : IRB symétrique, routes Type-2/Type-5 et passerelle anycast distribuée.
Obtenir le briefOcNOS 800G Lossless AI Fabric
Formulaire rapide. Votre PDF s'ouvre dans un nouvel onglet immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
Solution_Brief-OcNOS_800G_Ethernet-Based_Lossless_AI_Fabric.pdfFabric DC EVPN-VXLAN
Formulaire rapide. Votre PDF s'ouvre dans un nouvel onglet immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
OcNOS-modernize-your-data-center-EVPN-VxLAN_Solution-Brief.pdf