RoCE vs InfiniBand pour les clusters IA
RoCEv2 fait fonctionner le RDMA sur de l'Ethernet ouvert et multifournisseur ; InfiniBand est un fabric sans perte monofournisseur. RoCEv2 reste sans perte grâce à PFC et ECN et contrôle la congestion avec DCQCN, tandis qu'InfiniBand est sans perte par conception via un contrôle de flux par crédits. Pour la plupart des charges de travail IA, Ethernet avec RoCEv2 égale désormais InfiniBand tout en préservant le choix du matériel. Cette page les compare axe par axe.
Les mêmes GPU, deux façons de rester sans perte
À gauche : RoCEv2 sur Ethernet maintient des files peu profondes grâce à la pause PFC saut par saut, au marquage ECN sur le commutateur et au contrôle de débit DCQCN au niveau du NIC émetteur. À droite : InfiniBand utilise un contrôle de flux par crédits, n'émettant que lorsque le récepteur a annoncé des crédits de tampon. Les deux évitent les pertes ; l'un sur de l'Ethernet ouvert et multifournisseur, l'autre sur un fabric monofournisseur.
RoCE et InfiniBand, axe par axe
RoCE, c'est RDMA over Converged Ethernet ; la version qui compte pour l'IA est RoCEv2, qui encapsule le RDMA dans UDP/IP sur le port de destination 4791 de sorte que le trafic est routable sur un fabric Ethernet Layer 3. InfiniBand est une interconnexion dédiée issue de l'InfiniBand Trade Association, sans perte par architecture via un contrôle de flux par crédits. La question pratique pour un cluster IA est de savoir quel transport répond à la charge de travail tout en gardant des coûts, une chaîne d'approvisionnement et des opérations raisonnables.
| Axis | RoCERoCEv2 sur Ethernet, ouvert | InfiniBandfabric monofournisseur |
|---|---|---|
| Transport & standard | RDMA sur UDP/IP (RoCEv2, IBTA), routable en Layer 3 sur le port UDP de destination 4791. Repose sur de l'Ethernet IEEE standard. | Couches liaison et transport InfiniBand dédiées (IBTA), avec des commutateurs et des host channel adapters dédiés. |
| Comment il reste sans perte | PFC pour le contrôle de flux saut par saut, plus ECN avec DCQCN pour le contrôle de congestion de bout en bout, maintenant les files des commutateurs peu profondes afin que le RDMA évite les pertes. | Contrôle de flux par crédits : un émetteur ne transmet que contre des crédits de tampon annoncés par le récepteur, de sorte que le fabric est sans perte par conception. |
| Écosystème | Ouvert et multifournisseur à chaque couche : ASIC de commutation, commutateur, NIC, NOS et optiques provenant de fournisseurs indépendants. | De fait monofournisseur pour le silicon des NIC et des commutateurs ; le fabric, les adaptateurs et la gestion forment une seule pile. |
| Choix du silicon de commutation | Broadcom Tomahawk 5 (51.2 Tbps, 64x800G) et Tomahawk 4 (25.6 Tbps, 64x400G) sur les plateformes Edgecore et UfiSpace, entre autres. | Silicon provenant uniquement du fournisseur InfiniBand ; aucune offre d'ASIC ou de commutateur indépendante. |
| Contrôle de congestion | DCQCN de bout en bout : le commutateur marque ECN et le NIC émetteur réduit son débit. L'équilibrage de charge adaptatif (DLB) répartit les flux et rééquilibre en cas de congestion locale. | Contrôle de flux par crédits avec routage adaptatif intégré à la spécification. |
| Scale | On Tomahawk 5, a 2-tier fabric reaches roughly 2,048 GPUs at 1:1 (toward 8,000+ with 800G breakout); a 3-stage Clos extends to 16,000+ and up to about 65,536 endpoints. | Passe à l'échelle via des topologies fat-tree gérées par un subnet manager centralisé au sein du fabric d'un unique fournisseur. |
| Operations & tooling | Opérations Ethernet standard : BGP, EVPN, télémétrie gNMI/OpenConfig et la même automatisation (Ansible, NETCONF) utilisée dans tout le datacenter. | Outillage InfiniBand spécialisé et un subnet manager, distincts du modèle opérationnel du reste du datacenter. |
| Verrouillage fournisseur | Aucun de manière intrinsèque : combinez librement matériel et logiciel, et diversifiez les sources de la chaîne d'approvisionnement. | Élevé : NIC, commutateur, câblage et gestion proviennent généralement d'un unique fournisseur. |
| Cost trend | Les spines en matériel ouvert sous OcNOS-DC en 400G et 800G sont nettement moins chers que les fabrics monofournisseur, et l'écart se creuse à mesure que les débits de port augmentent. | La tarification monofournisseur applique une prime à capacité équivalente. |
InfiniBand est une marque déposée de l'InfiniBand Trade Association. NVIDIA et Mellanox sont des marques de leurs détenteurs respectifs. Cette comparaison est fournie à titre informatif et n'implique aucune affiliation ni approbation.
Là où chacun excelle
La bonne réponse dépend de la charge de travail. Choisissez InfiniBand lorsqu'un plancher de latence absolu est l'exigence ; choisissez RoCE lorsque le modèle d'exploitation, le coût ou la portée entre sites emporte la décision.
Le plancher de latence est la spécification
Simulation HPC fortement couplée où le plancher de latence absolu NIC-à-NIC importe plus que le coût total de possession, et clusters captifs monolocataires où une pile monofournisseur est acceptable.
Les opérations et la chaîne d'approvisionnement comptent
GPU-as-a-Service multilocataire et back-ends IA qui partagent un même modèle opérationnel, une même pile d'outillage et une chaîne d'approvisionnement multifournisseur avec le reste du datacenter.
Le coût par GPU est le critère décisif
Les spines en matériel ouvert associés à OcNOS-DC suppriment la prime réseau monofournisseur. Sur une configuration de plusieurs milliers de GPU, cela représente une part significative du budget matériel.
La fabric s'étend sur plusieurs data centers
Ethernet s'étend naturellement entre salles et régions grâce aux optiques cohérentes 400G ZR/ZR+, sans couche de passerelle longue distance distincte.
Comment OcNOS-DC concrétise la voie RoCEv2
OcNOS-DC fournit le substrat Ethernet sans perte qu'exige RoCEv2. Le commutateur apporte les primitives d'évitement de perte et de congestion ; RoCEv2 est le transport qui s'exécute sur le NIC. Ce sont des capacités de commutation vérifiées dans OcNOS-DC aujourd'hui.
PFC and ECN
Priority Flow Control, y compris le PFC-avec-QoS sur Layer 3 avec DCBX/LLDP, plus ECN et Dynamic ECN pour que les flux RDMA conservent des files peu profondes sans pertes.
Marquage DCQCN
Le commutateur marque ECN afin que la boucle DCQCN NIC-plus-commutateur de bout en bout puisse limiter le débit des émetteurs. ETS et WRED mettent en forme et gèrent les files qui acheminent le RDMA.
DLB et RTAG7
Équilibrage de charge dynamique (y compris Reactive Path Rebalance et Random Flow) avec le hachage RTAG7 répartit les collectifs et rééquilibre en cas de congestion locale.
Protection contre les interblocages PFC
PFC Deadlock Detection and Recovery plus le réglage des tampons maintiennent le fabric sans perte stable face à la propagation de pauses que le PFC peut engendrer.
gNMI / OpenConfig
Streaming Télémétrie gNMI et OpenConfig offrent une visibilité par priorité pour un réglage en boucle fermée lors de la mise en service du cluster et en fonctionnement nominal.
Aligné sur UEC 1.0
IP Infusion est membre contributeur de l'Ultra Ethernet Consortium, et OcNOS-DC s'aligne sur le Profil de fabric UEC 1.0, si bien que le fabric se prolonge à mesure que les NIC compatibles UEC arrivent. L'alignement n'est pas une revendication de certification.
Le choix du silicon est ouvert : OcNOS-DC fonctionne sur l'Edgecore AIS800-64D et l'UfiSpace S9321-64E / S9321-64EO (le -64EO ajoute le 400G ZR+) sur Broadcom Tomahawk 5, ainsi que sur l'Edgecore AS9736-64D sur Tomahawk 4, toutes des plateformes on-chip à tampon partagé optimisées pour RoCEv2. Un seul contrat IP Infusion couvre le logiciel et le matériel validé, avec un seul TAC et un seul SLA.
Pourquoi de nombreux opérateurs passent à Ethernet pour leurs back-ends IA
Le basculement est plus opérationnel et économique qu'une question de latence brute. Trois éléments pèsent vite sur une grande configuration : un modèle réseau unique partagé avec le reste du datacenter, une chaîne d'approvisionnement multifournisseur et un coût par port plus faible en 400G et 800G.
L'échelle est prouvée sur le terrain. Meta a décrit l'entraînement de ses plus grands modèles sur un fabric Ethernet RoCE au sein d'un cluster de 24,000 GPU, une taille que l'on supposait autrefois réservée à InfiniBand. L'équilibrage de charge adaptatif sur Tomahawk 4 et Tomahawk 5 redistribue les flux selon la congestion en temps réel, de sorte qu'un fabric bien exploité peut viser une utilisation supérieure à 90 pour cent là où le hachage statique la plafonnerait. Quatre-vingt-dix pour cent est un objectif de conception, pas une garantie mesurée.
L'avantage résiduel d'InfiniBand, un plancher de latence absolu plus bas, compte encore pour un ensemble de charges HPC fortement couplées. Pour la plupart des collectifs d'entraînement distribué et d'inférence à grande échelle, un fabric RoCEv2 correctement réglé se situe sous le seuil qui modifie le temps d'achèvement des tâches, ce qui explique pourquoi l'argument opérationnel et économique décide désormais la plupart des nouvelles configurations de back-end IA.
- Un modèle réseau unique partagé avec le reste du datacenter, de sorte que compétences et outillage se transposent.
- Une chaîne d'approvisionnement multifournisseur qui vous permet de diversifier les sources de silicon, de commutateurs, de NIC et d'optiques.
- Un coût par port plus faible en 400G et 800G, libérant du capital pour davantage de GPU, un étage de stockage plus vaste ou un second site.
Les deux sont valables, et la plupart des nouveaux back-ends IA optent pour Ethernet
InfiniBand conserve un plancher de latence absolu plus bas que continueront de payer un ensemble de charges HPC fortement couplées. Pour la plupart des configurations de back-end IA, l'argument opérationnel et économique tranche en faveur de RoCEv2 sur Ethernet ouvert.
Les deux sont valables
InfiniBand conserve un plancher de latence absolu plus bas que continueront de payer un ensemble de charges HPC fortement couplées.
RoCEv2 a comblé l'écart pour l'IA
Avec PFC, ECN, DCQCN et l'équilibrage de charge adaptatif correctement configurés, Ethernet égale InfiniBand sur la plupart des collectifs d'entraînement distribué tout en préservant le choix du matériel.
La décision est généralement opérationnelle
Un modèle réseau unique, une chaîne d'approvisionnement multifournisseur et un coût par port plus faible en 400G et 800G décident la plupart des nouvelles configurations de back-end IA.
OcNOS-DC est la voie ouverte
Des primitives RoCEv2 vérifiées aujourd'hui, alignées sur UEC 1.0 pour demain, sur du matériel ouvert validé d'Edgecore et UfiSpace, sous un seul contrat, un seul TAC et un seul SLA.
Obtenez la conception de référence de fabric IA
The full PDF: lossless RoCEv2 topology, switch and transceiver counts, validated platforms, and a DCQCN starting profile on OcNOS-DC.
Obtenez la conception de référence de fabric IA
Formulaire court : votre PDF se télécharge immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
FAQ RoCE vs InfiniBand
Quelle est la différence entre RoCE et InfiniBand ?
Ethernet est-il aussi rapide qu'InfiniBand pour l'IA ?
Qu'est-ce que RoCEv2 ?
RoCE nécessite-t-il un fabric sans perte ?
Puis-je faire fonctionner RoCE sur des commutateurs ouverts ?
Qu'en est-il d'Ultra Ethernet ?
Approfondissez. Emportez-le avec vous.
La fiche technique du produit et des téléchargements techniques et concis qui vont plus loin que cette page.
Datasheet OcNOS-DC
Spécification complète OcNOS-DC : l'ensemble des fonctionnalités EVPN-VXLAN et Ethernet for AI, les SKU logiciels, les plateformes matérielles prises en charge et le guide de commande de la solution.
Obtenir la fiche techniqueOcNOS 800G Fabric IA sans perte
Fabric RoCEv2 non bloquante sur des spines Broadcom Tomahawk 4/5 : niveaux de SKU, plateformes validées et architecture de déploiement.
Obtenir le briefFabric DC EVPN-VXLAN
Fabric de data center leaf-spine de niveau opérateur : IRB symétrique, routes Type-2/Type-5 et passerelle anycast distribuée.
Obtenir le briefDatasheet OcNOS-DC
Formulaire rapide. Votre PDF s'ouvre dans un nouvel onglet immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
OcNOS 800G Fabric IA sans perte
Formulaire rapide. Votre PDF s'ouvre dans un nouvel onglet immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
Fabric DC EVPN-VXLAN
Formulaire rapide. Votre PDF s'ouvre dans un nouvel onglet immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
Vous dimensionnez un fabric RoCEv2 face à InfiniBand ? Faisons les calculs adaptés à votre charge de travail
Indiquez-nous la charge de travail et l'échelle GPU, et un ingénieur IP Infusion réalisera les calculs avec vous, ou commencez par une première ébauche de topologie leaf-spine dans l'AI Fabric Design Suite.
Concevez tout le fabric IA avec OcNOS
Du dossier économique au calcul du nombre de ports, reprenez où vous en êtes dans la construction.