RoCEv2 · DLB · Ultra Ethernet

InfiniBand vs Ethernet pour les fabrics IA

Pour la plupart des fabrics IA, Ethernet. Pour le HPC à latence critique, InfiniBand. L'Ethernet moderne avec RoCEv2 fait désormais tourner des fabrics de production à 400G et 800G sur du matériel ouvert et multi-fournisseur, et OcNOS-DC le fournit dès aujourd'hui. Ce guide explique où chacun garde sa place.

Two-thirdsPart d'Ethernet, scale-out IA
jusqu'à 800Gfabrics RoCEv2 en production
1 NOSOcNOS-DC sur matériel ouvert
600+réseaux opérateurs sur OcNOS
Deux fabrics, deux modèles d'exploitation

Les mêmes GPU, deux réseaux très différents

À gauche, un fabric InfiniBand mono-fournisseur : un seul fournisseur de silicon, une seule gamme de commutateurs, un seul écosystème de NIC, et un subnet manager distinct du reste du data center. À droite, un fabric Ethernet ouvert et multi-fournisseur : des NIC RoCEv2 ou UEC de n'importe quel fournisseur, du silicon de commutation Broadcom, OcNOS-DC comme NOS, et les mêmes protocoles que vous exécutez déjà.

Fabric InfiniBand mono-fournisseur vs fabric Ethernet multi-fournisseurs Two side-by-side fabric topologies. Left: a single-vendor InfiniBand fabric with two IB switches and three GPUs. Right: a multi-vendor Ethernet fabric with two OcNOS-DC spines and three GPUs with RoCEv2 or UEC NICs. Bottom labels contrast a single-vendor stack with an open multi-vendor stack. INFINIBAND · SINGLE-VENDOR ETHERNET · OPEN MULTI-VENDOR IB Switch-1Quantum-class IB Switch-2Quantum-class GPUIB NIC GPUIB NIC GPUIB NIC SINGLE NIC + SWITCH VENDOR SUBNET MANAGER · LIMITED MULTI-TENANCY Spine-1OcNOS-DC · TH5 Spine-2OcNOS-DC · TH5 GPURoCEv2/UEC GPURoCEv2/UEC GPURoCEv2/UEC MULTI-VENDOR · OPEN HARDWARE RoCEv2 · DLB · GLB · UEC · EVPN-VXLAN · gNMI SINGLE-VENDOR STACK vs OPEN MULTI-VENDOR STACK
Le comparatif

InfiniBand et Ethernet, axe par axe

InfiniBand a été conçu spécifiquement pour du RDMA sans perte à faible latence, et pendant deux décennies cela lui a donné un réel avantage pour le HPC fortement couplé. L'Ethernet moderne, bâti sur la pile DCB, RoCEv2, et de plus en plus DLB et UEC, a passé ces dernières années à combler cet écart. Les écarts qui comptent encore dépendent de la charge de travail.

Axis InfiniBandsingle-vendor EthernetRoCEv2 / UEC, ouvert
Plancher de latenceLatence NIC-à-NIC de bout en bout très faible ; généralement quelques centaines de nanosecondes par saut de switch.Plancher supérieur à l'IB de plusieurs centaines de nanosecondes, mais bien en deçà du seuil qui affecte la plupart des collectives d'entraînement distribué à grande échelle.
Tolérance aux pertesSans perte par architecture (contrôle de flux basé sur crédits).Lossless via PFC + ECN + DCQCN. De niveau production dès aujourd'hui ; UEC réduit davantage la dépendance à la pause PFC.
Multi-chemin / répartition de chargeRoutage adaptatif intégré à la spécification.ECMP statique, plus DLB pour l'adaptatif à un seul saut, GLB (OcNOS 7.1) pour le bout en bout, et le packet-spray UEC pour la prochaine génération.
Écosystème de fournisseursQuasiment mono-fournisseur pour le silicon de NIC comme de commutateur.Multi-fournisseur à chaque couche : ASIC, switch, NIC, NOS, optique. L'UEC est explicitement conçu pour une interopérabilité neutre vis-à-vis des fournisseurs.
Modèle opérationnelGestionnaire de subnet (classe UFM). Différent du reste du DC. Compétences distinctes, outillage distinct.Les mêmes BGP, EVPN, gNMI que vous utilisez déjà. Les mêmes outils d'automatisation (Ansible, NETCONF, OpenConfig) que le reste du DC.
Multi-tenancyLimité ; le partitionnement existe mais n'est pas un concept de premier ordre.De première classe via EVPN-VXLAN. GPU-as-a-Service, clusters multi-équipes, infrastructure partagée, tout est naturel.
DCI longue distanceNon conçu pour cela ; nécessite des passerelles IB-over-WAN.Nativement via les pluggables cohérents 400G ZR/ZR+ et l'EVPN inter-DC.
Convergence du stockageLe stockage fonctionne aux côtés du calcul ; nécessite un stockage attaché en IB.NVMe-oF, NFS, S3 sur une même fabric Ethernet.
Coût / port (400G+ typique)Premium ; tarification mono-fournisseur.Un spine en matériel ouvert + le NOS OcNOS-DC fait sensiblement mieux que les alternatives verrouillées par le fournisseur.
Cadence de la roadmapDictée par la cadence de publication d'un seul fournisseur.Le consortium UEC (AMD, Arista, Broadcom, Cisco, HPE, Intel, Meta, Microsoft, Oracle) pilote une évolution de spécification publiée ouvertement.
La décision

Là où chacun excelle

La bonne réponse dépend de la charge de travail. Choisissez InfiniBand lorsqu'un plancher de latence absolu est l'exigence ; choisissez Ethernet lorsque le modèle d'exploitation, le coût ou la portée entre sites emporte la décision.

Choisissez InfiniBand lorsque

Le plancher de latence est contractuel

Simulation HPC où le plancher de latence absolu compte plus que le coût total de possession, et clusters mono-tenant captifs et serrés où le verrouillage fournisseur est acceptable.

Choisissez Ethernet quand

Le modèle d'exploitation compte

GPU-as-a-Service multi-tenant et clusters qui partagent l'infrastructure avec le reste du data center, où un seul modèle d'exploitation, une seule pile d'outils et une chaîne d'approvisionnement multi-fournisseur l'emportent.

Choisissez Ethernet quand

Le coût par GPU-flop est le facteur décisif

Des spines en matériel ouvert avec OcNOS-DC éliminent la surprime réseau mono-fournisseur. Sur un cluster de plusieurs milliers de GPU, cela représente une part significative du budget matériel.

Choisissez Ethernet quand

La fabric s'étend sur plusieurs data centers

Si un entraînement doit un jour traverser deux salles ou deux régions, le DCI cohérent, l'EVPN inter-DC et l'optique standard multi-fournisseur en font un problème d'une journée plutôt qu'un projet de système de ligne long d'un trimestre.

Là où l'écart s'est comblé

Ce que l'Ethernet moderne a apporté

Trois avancées ont fait passer les fabrics IA de production sur Ethernet : un comportement réellement sans perte, un routage adaptatif qui écarte les flux des liens montants congestionnés, et un transport de nouvelle génération compatible avec le packet spray.

Comportement sans perte

RoCEv2 with PFC, DCQCN et le watchdog anti-deadlock PFC fournit le transport RDMA sans perte dont les collectives IA ont besoin, de niveau production dès aujourd'hui sur Ethernet standard.

Routage adaptatif

Les collisions ECMP statiques sur les charges IA sont réelles, mais DLB redistribue les flowlets en cas de congestion locale dans des fenêtres inférieures à la milliseconde, et GLB dans OcNOS 7.1 étend cela à une évaluation de chemin de bout en bout.

Transport compatible packet spray

Ultra Ethernet (UEC 1.0, juin 2025) apporte le packet spray, le RDMA multichemin et la livraison dans le désordre à l'Ethernet standard. Bâtissez sur RoCEv2 dès maintenant et gardez une voie claire vers UEC à mesure que les NIC arrivent.

La question du TCO

Le réseau est un petit poste de dépense, alors concentrez la comparaison sur ce qu'il libère

Sur cinq ans, la couche de commutation représente un pourcentage à un chiffre du TCO du cluster, qui augmente une fois les NIC, l'optique et le câblage comptabilisés. La question utile n'est pas le poste de dépense, mais ce que le capital économisé finance.

  • À capacité équivalente, l'InfiniBand mono-fournisseur comporte une surprime par rapport à l'Ethernet en matériel ouvert.
  • Le capital économisé finance davantage de GPU, un palier de stockage plus important, ou un second site pour la résilience.
  • Lorsque le fabric est multi-tenant ou partagé avec le reste du data center, un modèle réseau unique vaut plus que la différence de poste de dépense.
Le point de vue d'IP Infusion

Les deux ont leur place, et la plupart des fabrics IA relèvent d'Ethernet

Ethernet ne l'emporte pas sur toutes les charges de travail, mais l'argument opérationnel et économique est décisif pour la plupart, et il se renforce à mesure que l'écart technique se comble.

Les deux ont leur place

Ethernet ne l'emporte pas sur toutes les charges de travail. Les clusters HPC serrés aux exigences de latence à plancher absolu privilégient encore InfiniBand.

La plupart des fabrics IA relèvent d'Ethernet

L'entraînement et l'inférence IA de production à l'échelle hyperscale migrent vers Ethernet à mesure que l'argument opérationnel et économique se renforce et que l'écart technique continue de se combler.

OcNOS-DC est la voie ouverte

RoCEv2 aujourd'hui, DLB aujourd'hui, GLB ensuite, UEC à mesure que les NIC sortent. Un seul NOS, une seule feuille de route fonctionnelle, sur du matériel ouvert validé d'Edgecore, UfiSpace et d'autres.

FAQ

InfiniBand vs Ethernet, les réponses

L'Ethernet est-il assez rapide pour l'entraînement d'AI face à InfiniBand ?
Pour la plupart des collectifs d'entraînement distribué à grande échelle, oui. Ethernet présente un plancher de latence supérieur de plusieurs centaines de nanosecondes à celui d'InfiniBand, mais cela reste en deçà du seuil affectant la plupart des charges de travail dès lors que RoCEv2 avec PFC, DCQCN et DLB est correctement configuré.
Dans quels cas convient-il encore de choisir InfiniBand ?
Optez pour InfiniBand dans les simulations HPC étroitement couplées, où le plancher absolu de latence prime sur le total cost of ownership, ainsi que pour les clusters captifs mono-locataire où le lock-in mono-fournisseur est acceptable.
Dans quels cas Ethernet s'impose-t-il pour une AI fabric ?
L'Ethernet s'impose pour le GPU-as-a-Service multilocataire, pour les clusters qui partagent un même modèle d'exploitation et un même outillage avec le reste du data center, pour les déploiements de plusieurs milliers de GPU sensibles aux coûts, et pour les fabrics s'étendant d'un data center à l'autre via coherent DCI et EVPN.
Comment OcNOS comble-t-il l'écart avec InfiniBand ?
OcNOS-DC fournit dès aujourd'hui le transport RoCEv2 lossless, le routage adaptatif DLB et le watchdog anti-deadlock PFC, le GLB en 7.1 pour le scoring de chemin de bout en bout, et la prise en charge d'UEC à mesure que les NIC sont livrés, le tout sur de l'open hardware validé issu de fournisseurs tels qu'Edgecore et UfiSpace.
Les hyperscalers remplacent-ils InfiniBand par Ethernet pour l'IA ?
En grande partie oui, même si InfiniBand ne disparaît pas. Selon le Dell'Oro Group, Ethernet a dépassé InfiniBand dans la commutation back-end (scale-out) de l'IA et a atteint environ deux tiers du marché début 2026, contre une part d'environ 80 pour cent pour InfiniBand fin 2023. Dell'Oro note également un net rebond d'InfiniBand avec la montée en puissance du NVIDIA Blackwell Ultra 800G, si bien qu'il reste le choix spécialisé pour le HPC fortement couplé. Meta a décrit l'entraînement de ses plus grands modèles sur un fabric Ethernet RoCE, sur l'un de deux clusters de 24,576 GPU. L'Ultra Ethernet Consortium, dont les membres du comité de pilotage incluent AMD, Arista, Broadcom, Cisco, Eviden, HPE, Intel, Meta, Microsoft et Oracle, normalise cette orientation. Les raisons sont opérationnelles et économiques : un modèle réseau unique partagé avec le reste du data center, une chaîne d'approvisionnement multi-fournisseur, et un coût par port plus faible à 400G et 800G.
Quelle est la meilleure alternative à InfiniBand pour la mise en réseau de clusters IA ?
L'Ethernet avec RoCEv2 est l'alternative courante. Il transporte le RDMA sans perte à l'aide de PFC, ECN et DCQCN, ajoute le routage adaptatif via DLB, et gagne le packet spray et le RDMA multichemin via Ultra Ethernet à mesure que les NIC UEC arrivent. Sur du matériel ouvert exécutant OcNOS-DC, il assure cela sur une pile multi-fournisseur plutôt que sur un fabric mono-fournisseur.
Quelle est la différence entre Ultra Ethernet et InfiniBand ?
Ultra Ethernet (UEC) apporte à l'Ethernet standard les techniques de transport qui ont défini InfiniBand : packet spray sur tous les chemins, RDMA multichemin, livraison dans le désordre et retransmission sélective. La spécification UEC 1.0, publiée en juin 2025, définit ce transport. La différence tient à l'écosystème : InfiniBand est de fait mono-fournisseur pour le silicon des NIC et des commutateurs, tandis qu'Ultra Ethernet est une spécification ouverte et multi-fournisseur que tout fournisseur peut implémenter.
Combien coûte un fabric IA Ethernet par rapport à InfiniBand ?
La couche de commutation représente une part modeste du coût total de possession d'un cluster IA, généralement un pourcentage à un chiffre sur cinq ans, même si ce chiffre augmente une fois les NIC, l'optique et le câblage comptabilisés. À capacité équivalente, l'InfiniBand mono-fournisseur comporte généralement une surprime par rapport à l'Ethernet en matériel ouvert exécutant OcNOS-DC. La question la plus utile est de savoir ce que finance le capital économisé, qu'il s'agisse de davantage de GPU, d'un palier de stockage plus important ou d'un second site pour la résilience.

Vous dimensionnez votre prochain cluster ? Obtenez une analyse adaptée à votre charge de travail

Indiquez-nous la charge de travail et l'échelle GPU, et un ingénieur IP Infusion fera les calculs avec vous, ou commencez par un premier jet de topologie leaf-spine dans l'AI Fabric Design Suite.