RoCEv2 · PFC / ECN · DCQCN

RoCE vs InfiniBand pour les clusters IA

RoCEv2 fait fonctionner le RDMA sur de l'Ethernet ouvert et multifournisseur ; InfiniBand est un fabric sans perte monofournisseur. RoCEv2 reste sans perte grâce à PFC et ECN et contrôle la congestion avec DCQCN, tandis qu'InfiniBand est sans perte par conception via un contrôle de flux par crédits. Pour la plupart des charges de travail IA, Ethernet avec RoCEv2 égale désormais InfiniBand tout en préservant le choix du matériel. Cette page les compare axe par axe.

UDP 4791RDMA routable en Layer 3
jusqu'à 800Gfabrics RoCEv2 ouverts
1 contractOcNOS-DC + matériel validé
600+réseaux opérateurs sur OcNOS
Deux fabrics, deux façons de rester sans perte

Les mêmes GPU, deux façons de rester sans perte

À gauche : RoCEv2 sur Ethernet maintient des files peu profondes grâce à la pause PFC saut par saut, au marquage ECN sur le commutateur et au contrôle de débit DCQCN au niveau du NIC émetteur. À droite : InfiniBand utilise un contrôle de flux par crédits, n'émettant que lorsque le récepteur a annoncé des crédits de tampon. Les deux évitent les pertes ; l'un sur de l'Ethernet ouvert et multifournisseur, l'autre sur un fabric monofournisseur.

RoCEv2 PFC/ECN/DCQCN loop versus InfiniBand credit-based flow control Two side-by-side diagrams. Left: a sending GPU NIC and a receiving GPU NIC connected through an Ethernet switch running OcNOS-DC. PFC pause acts hop-by-hop, the switch marks ECN on congestion, and a DCQCN signal returns to the sending NIC to lower its rate. Right: an InfiniBand switch and adapter exchanging buffer credits, so a sender transmits only when the receiver has advertised credit. Bottom band contrasts open multi-vendor Ethernet with a single-vendor InfiniBand fabric. RoCEv2 · OPEN ETHERNET INFINIBAND · SINGLE-VENDOR GPU NICsender SwitchOcNOS-DC · TH5 GPU NICreceiver ECN mark PFC pause (hop-by-hop) DCQCN rate control to sender PFC + ECN keep the fabric lossless · DCQCN controls congestion IB Switchsubnet manager GPU HCAIB adapter data (only if credits > 0) buffer credits Credit-based flow control · lossless by design · single ecosystem OPEN MULTI-VENDOR ETHERNET vs SINGLE-VENDOR INFINIBAND FABRIC
Le comparatif

RoCE et InfiniBand, axe par axe

RoCE, c'est RDMA over Converged Ethernet ; la version qui compte pour l'IA est RoCEv2, qui encapsule le RDMA dans UDP/IP sur le port de destination 4791 de sorte que le trafic est routable sur un fabric Ethernet Layer 3. InfiniBand est une interconnexion dédiée issue de l'InfiniBand Trade Association, sans perte par architecture via un contrôle de flux par crédits. La question pratique pour un cluster IA est de savoir quel transport répond à la charge de travail tout en gardant des coûts, une chaîne d'approvisionnement et des opérations raisonnables.

Axis RoCERoCEv2 sur Ethernet, ouvert InfiniBandfabric monofournisseur
Transport & standardRDMA sur UDP/IP (RoCEv2, IBTA), routable en Layer 3 sur le port UDP de destination 4791. Repose sur de l'Ethernet IEEE standard.Couches liaison et transport InfiniBand dédiées (IBTA), avec des commutateurs et des host channel adapters dédiés.
Comment il reste sans pertePFC pour le contrôle de flux saut par saut, plus ECN avec DCQCN pour le contrôle de congestion de bout en bout, maintenant les files des commutateurs peu profondes afin que le RDMA évite les pertes.Contrôle de flux par crédits : un émetteur ne transmet que contre des crédits de tampon annoncés par le récepteur, de sorte que le fabric est sans perte par conception.
ÉcosystèmeOuvert et multifournisseur à chaque couche : ASIC de commutation, commutateur, NIC, NOS et optiques provenant de fournisseurs indépendants.De fait monofournisseur pour le silicon des NIC et des commutateurs ; le fabric, les adaptateurs et la gestion forment une seule pile.
Choix du silicon de commutationBroadcom Tomahawk 5 (51.2 Tbps, 64x800G) et Tomahawk 4 (25.6 Tbps, 64x400G) sur les plateformes Edgecore et UfiSpace, entre autres.Silicon provenant uniquement du fournisseur InfiniBand ; aucune offre d'ASIC ou de commutateur indépendante.
Contrôle de congestionDCQCN de bout en bout : le commutateur marque ECN et le NIC émetteur réduit son débit. L'équilibrage de charge adaptatif (DLB) répartit les flux et rééquilibre en cas de congestion locale.Contrôle de flux par crédits avec routage adaptatif intégré à la spécification.
ScaleOn Tomahawk 5, a 2-tier fabric reaches roughly 2,048 GPUs at 1:1 (toward 8,000+ with 800G breakout); a 3-stage Clos extends to 16,000+ and up to about 65,536 endpoints.Passe à l'échelle via des topologies fat-tree gérées par un subnet manager centralisé au sein du fabric d'un unique fournisseur.
Operations & toolingOpérations Ethernet standard : BGP, EVPN, télémétrie gNMI/OpenConfig et la même automatisation (Ansible, NETCONF) utilisée dans tout le datacenter.Outillage InfiniBand spécialisé et un subnet manager, distincts du modèle opérationnel du reste du datacenter.
Verrouillage fournisseurAucun de manière intrinsèque : combinez librement matériel et logiciel, et diversifiez les sources de la chaîne d'approvisionnement.Élevé : NIC, commutateur, câblage et gestion proviennent généralement d'un unique fournisseur.
Cost trendLes spines en matériel ouvert sous OcNOS-DC en 400G et 800G sont nettement moins chers que les fabrics monofournisseur, et l'écart se creuse à mesure que les débits de port augmentent.La tarification monofournisseur applique une prime à capacité équivalente.

InfiniBand est une marque déposée de l'InfiniBand Trade Association. NVIDIA et Mellanox sont des marques de leurs détenteurs respectifs. Cette comparaison est fournie à titre informatif et n'implique aucune affiliation ni approbation.

La décision

Là où chacun excelle

La bonne réponse dépend de la charge de travail. Choisissez InfiniBand lorsqu'un plancher de latence absolu est l'exigence ; choisissez RoCE lorsque le modèle d'exploitation, le coût ou la portée entre sites emporte la décision.

InfiniBand convient lorsque

Le plancher de latence est la spécification

Simulation HPC fortement couplée où le plancher de latence absolu NIC-à-NIC importe plus que le coût total de possession, et clusters captifs monolocataires où une pile monofournisseur est acceptable.

RoCE convient lorsque

Les opérations et la chaîne d'approvisionnement comptent

GPU-as-a-Service multilocataire et back-ends IA qui partagent un même modèle opérationnel, une même pile d'outillage et une chaîne d'approvisionnement multifournisseur avec le reste du datacenter.

RoCE convient lorsque

Le coût par GPU est le critère décisif

Les spines en matériel ouvert associés à OcNOS-DC suppriment la prime réseau monofournisseur. Sur une configuration de plusieurs milliers de GPU, cela représente une part significative du budget matériel.

RoCE convient lorsque

La fabric s'étend sur plusieurs data centers

Ethernet s'étend naturellement entre salles et régions grâce aux optiques cohérentes 400G ZR/ZR+, sans couche de passerelle longue distance distincte.

La voie ouverte

Comment OcNOS-DC concrétise la voie RoCEv2

OcNOS-DC fournit le substrat Ethernet sans perte qu'exige RoCEv2. Le commutateur apporte les primitives d'évitement de perte et de congestion ; RoCEv2 est le transport qui s'exécute sur le NIC. Ce sont des capacités de commutation vérifiées dans OcNOS-DC aujourd'hui.

Losslessness

PFC and ECN

Priority Flow Control, y compris le PFC-avec-QoS sur Layer 3 avec DCBX/LLDP, plus ECN et Dynamic ECN pour que les flux RDMA conservent des files peu profondes sans pertes.

Congestion

Marquage DCQCN

Le commutateur marque ECN afin que la boucle DCQCN NIC-plus-commutateur de bout en bout puisse limiter le débit des émetteurs. ETS et WRED mettent en forme et gèrent les files qui acheminent le RDMA.

Équilibrage de charge

DLB et RTAG7

Équilibrage de charge dynamique (y compris Reactive Path Rebalance et Random Flow) avec le hachage RTAG7 répartit les collectifs et rééquilibre en cas de congestion locale.

Resilience

Protection contre les interblocages PFC

PFC Deadlock Detection and Recovery plus le réglage des tampons maintiennent le fabric sans perte stable face à la propagation de pauses que le PFC peut engendrer.

Télémétrie

gNMI / OpenConfig

Streaming Télémétrie gNMI et OpenConfig offrent une visibilité par priorité pour un réglage en boucle fermée lors de la mise en service du cluster et en fonctionnement nominal.

UEC-ready

Aligné sur UEC 1.0

IP Infusion est membre contributeur de l'Ultra Ethernet Consortium, et OcNOS-DC s'aligne sur le Profil de fabric UEC 1.0, si bien que le fabric se prolonge à mesure que les NIC compatibles UEC arrivent. L'alignement n'est pas une revendication de certification.

Le choix du silicon est ouvert : OcNOS-DC fonctionne sur l'Edgecore AIS800-64D et l'UfiSpace S9321-64E / S9321-64EO (le -64EO ajoute le 400G ZR+) sur Broadcom Tomahawk 5, ainsi que sur l'Edgecore AS9736-64D sur Tomahawk 4, toutes des plateformes on-chip à tampon partagé optimisées pour RoCEv2. Un seul contrat IP Infusion couvre le logiciel et le matériel validé, avec un seul TAC et un seul SLA.

Pourquoi ce basculement

Pourquoi de nombreux opérateurs passent à Ethernet pour leurs back-ends IA

Le basculement est plus opérationnel et économique qu'une question de latence brute. Trois éléments pèsent vite sur une grande configuration : un modèle réseau unique partagé avec le reste du datacenter, une chaîne d'approvisionnement multifournisseur et un coût par port plus faible en 400G et 800G.

L'échelle est prouvée sur le terrain. Meta a décrit l'entraînement de ses plus grands modèles sur un fabric Ethernet RoCE au sein d'un cluster de 24,000 GPU, une taille que l'on supposait autrefois réservée à InfiniBand. L'équilibrage de charge adaptatif sur Tomahawk 4 et Tomahawk 5 redistribue les flux selon la congestion en temps réel, de sorte qu'un fabric bien exploité peut viser une utilisation supérieure à 90 pour cent là où le hachage statique la plafonnerait. Quatre-vingt-dix pour cent est un objectif de conception, pas une garantie mesurée.

L'avantage résiduel d'InfiniBand, un plancher de latence absolu plus bas, compte encore pour un ensemble de charges HPC fortement couplées. Pour la plupart des collectifs d'entraînement distribué et d'inférence à grande échelle, un fabric RoCEv2 correctement réglé se situe sous le seuil qui modifie le temps d'achèvement des tâches, ce qui explique pourquoi l'argument opérationnel et économique décide désormais la plupart des nouvelles configurations de back-end IA.

  • Un modèle réseau unique partagé avec le reste du datacenter, de sorte que compétences et outillage se transposent.
  • Une chaîne d'approvisionnement multifournisseur qui vous permet de diversifier les sources de silicon, de commutateurs, de NIC et d'optiques.
  • Un coût par port plus faible en 400G et 800G, libérant du capital pour davantage de GPU, un étage de stockage plus vaste ou un second site.
En bref

Les deux sont valables, et la plupart des nouveaux back-ends IA optent pour Ethernet

InfiniBand conserve un plancher de latence absolu plus bas que continueront de payer un ensemble de charges HPC fortement couplées. Pour la plupart des configurations de back-end IA, l'argument opérationnel et économique tranche en faveur de RoCEv2 sur Ethernet ouvert.

Les deux sont valables

InfiniBand conserve un plancher de latence absolu plus bas que continueront de payer un ensemble de charges HPC fortement couplées.

RoCEv2 a comblé l'écart pour l'IA

Avec PFC, ECN, DCQCN et l'équilibrage de charge adaptatif correctement configurés, Ethernet égale InfiniBand sur la plupart des collectifs d'entraînement distribué tout en préservant le choix du matériel.

La décision est généralement opérationnelle

Un modèle réseau unique, une chaîne d'approvisionnement multifournisseur et un coût par port plus faible en 400G et 800G décident la plupart des nouvelles configurations de back-end IA.

OcNOS-DC est la voie ouverte

Des primitives RoCEv2 vérifiées aujourd'hui, alignées sur UEC 1.0 pour demain, sur du matériel ouvert validé d'Edgecore et UfiSpace, sous un seul contrat, un seul TAC et un seul SLA.

Ressource

Obtenez la conception de référence de fabric IA

The full PDF: lossless RoCEv2 topology, switch and transceiver counts, validated platforms, and a DCQCN starting profile on OcNOS-DC.

Télécharger le PDF
FAQ

FAQ RoCE vs InfiniBand

Quelle est la différence entre RoCE et InfiniBand ?
RoCE (en pratique RoCEv2) transporte le RDMA sur de l'Ethernet et de l'IP standard et routables, si bien qu'il réutilise les commutateurs, NIC, optiques et outillage opérationnel que n'importe quel fournisseur peut fournir. InfiniBand est un fabric dédié distinct, avec ses propres commutateurs, adaptateurs, câblage et subnet manager issus d'un unique fournisseur. RoCEv2 maintient le fabric sans perte avec PFC et ECN et contrôle la congestion avec DCQCN, tandis qu'InfiniBand repose sur un contrôle de flux par crédits, sans perte par conception.
Ethernet est-il aussi rapide qu'InfiniBand pour l'IA ?
Pour la plupart des collectifs d'entraînement distribué à grande échelle, oui. InfiniBand conserve un plancher de latence absolu plus bas de quelques centaines de nanosecondes, mais une fois RoCEv2 configuré avec PFC, ECN, DCQCN et l'équilibrage de charge adaptatif, cet écart passe sous le niveau qui modifie le temps d'achèvement des tâches pour la majorité des charges de travail IA. De nombreux opérateurs font désormais tourner de grands réseaux de back-end IA sur Ethernet pour cette raison.
Qu'est-ce que RoCEv2 ?
RoCEv2 (RDMA over Converged Ethernet version 2) encapsule le RDMA dans UDP/IP sur le port de destination 4791, si bien que le trafic RDMA est routable sur des fabrics Ethernet Layer 3. Il permet aux GPU et au stockage de déplacer des données directement de mémoire à mémoire avec une faible latence et une faible charge CPU, ce qui en fait la manière courante de faire fonctionner le RDMA sur un réseau Ethernet ouvert et multifournisseur.
RoCE nécessite-t-il un fabric sans perte ?
Oui. Les performances de RoCEv2 chutent fortement en cas de perte de paquets ; il lui faut donc un fabric sans perte ou quasi sans perte. Les opérateurs l'assurent avec PFC pour le contrôle de flux saut par saut et ECN avec DCQCN pour le contrôle de congestion de bout en bout, en maintenant les files des commutateurs peu profondes afin que les flux RDMA évitent pertes et retransmissions. Le commutateur fournit le substrat sans perte ; RoCEv2 est le transport qui s'exécute sur le NIC.
Puis-je faire fonctionner RoCE sur des commutateurs ouverts ?
Oui. RoCEv2 fonctionne sur du silicon Ethernet standard. OcNOS-DC fournit les briques de base de RoCEv2 (PFC, PFC-avec-QoS sur Layer 3, ECN, Dynamic ECN, ETS, WRED, DLB, PFC deadlock detection and recovery, et télémétrie gNMI/OpenConfig) sur du matériel ouvert validé tel que les plateformes Edgecore et UfiSpace bâties sur Broadcom Tomahawk 4 et Tomahawk 5. Un seul contrat IP Infusion couvre le logiciel et le matériel validé.
Qu'en est-il d'Ultra Ethernet ?
Ultra Ethernet (UEC) est le standard ouvert qui apporte à Ethernet le packet spray, le RDMA multi-chemins, la livraison en désordre et un contrôle de congestion moderne, réduisant ce qu'InfiniBand faisait autrefois de façon unique. IP Infusion est membre contributeur de l'Ultra Ethernet Consortium, et OcNOS-DC s'aligne aujourd'hui sur le profil de fabric UEC 1.0, le transport UEC complet entrant en jeu à mesure que les NIC compatibles UEC arrivent. L'alignement sur le profil n'est pas une revendication de certification.

Vous dimensionnez un fabric RoCEv2 face à InfiniBand ? Faisons les calculs adaptés à votre charge de travail

Indiquez-nous la charge de travail et l'échelle GPU, et un ingénieur IP Infusion réalisera les calculs avec vous, ou commencez par une première ébauche de topologie leaf-spine dans l'AI Fabric Design Suite.