RoCEv2 · DLB · Ultra Ethernet

InfiniBand vs. Ethernet für AI-Fabrics

Für die meisten KI-Fabrics Ethernet. Für latenzkritisches HPC InfiniBand. Modernes Ethernet mit RoCEv2 betreibt heute Produktions-Fabrics mit 400G und 800G auf offener Multi-Vendor-Hardware, und OcNOS-DC liefert das bereits heute. Dieser Leitfaden zeigt, wo sich beide jeweils noch eignen.

Two-thirdsEthernet-Anteil, KI-Scale-out
bis zu 800Gproduktive RoCEv2-Fabrics
1 NOSOcNOS-DC auf offener Hardware
600+Betreibernetze auf OcNOS
Zwei Fabrics, zwei Betriebsmodelle

Dieselben GPUs, zwei sehr unterschiedliche Netzwerke

Links eine Single-Vendor-InfiniBand-Fabric: ein Silizium-Anbieter, eine Switch-Linie, ein NIC-Ökosystem und ein Subnet-Manager, der vom Rest des Rechenzentrums getrennt ist. Rechts eine offene Multi-Vendor-Ethernet-Fabric: RoCEv2- oder UEC-NICs beliebiger Anbieter, Broadcom-Switch-Silizium, OcNOS-DC als NOS und dieselben Protokolle, die Sie bereits betreiben.

InfiniBand-Single-Vendor-Fabric vs. Multi-Vendor-Ethernet-Fabric Two side-by-side fabric topologies. Left: a single-vendor InfiniBand fabric with two IB switches and three GPUs. Right: a multi-vendor Ethernet fabric with two OcNOS-DC spines and three GPUs with RoCEv2 or UEC NICs. Bottom labels contrast a single-vendor stack with an open multi-vendor stack. INFINIBAND · SINGLE-VENDOR ETHERNET · OPEN MULTI-VENDOR IB Switch-1Quantum-class IB Switch-2Quantum-class GPUIB NIC GPUIB NIC GPUIB NIC SINGLE NIC + SWITCH VENDOR SUBNET MANAGER · LIMITED MULTI-TENANCY Spine-1OcNOS-DC · TH5 Spine-2OcNOS-DC · TH5 GPURoCEv2/UEC GPURoCEv2/UEC GPURoCEv2/UEC MULTI-VENDOR · OPEN HARDWARE RoCEv2 · DLB · GLB · UEC · EVPN-VXLAN · gNMI SINGLE-VENDOR STACK vs OPEN MULTI-VENDOR STACK
Wie sie abschneiden

InfiniBand und Ethernet, Achse für Achse

InfiniBand wurde gezielt für latenzarmes, verlustfreies RDMA entwickelt, und zwei Jahrzehnte lang verschaffte ihm das einen echten Vorsprung bei eng gekoppeltem HPC. Modernes Ethernet, aufgebaut auf dem DCB-Stack, RoCEv2 sowie zunehmend DLB und UEC, hat diesen Abstand in den letzten Jahren geschlossen. Welche Lücken noch relevant sind, hängt vom Workload ab.

Axis InfiniBandsingle-vendor EthernetRoCEv2 / UEC, offen
LatenzuntergrenzeSehr geringe End-to-End-Latenz von NIC zu NIC: typischerweise einige hundert Nanosekunden pro Switch-Hop.Höhere Untergrenze als IB um mehrere hundert Nanosekunden, jedoch deutlich unterhalb der Schwelle, die die meisten verteilten Trainings-Collectives im großen Maßstab beeinträchtigt.
VerlusttoleranzLossless durch Architektur (Credit-based Flow Control).Lossless über PFC + ECN + DCQCN. Schon heute produktionsreif; UEC reduziert die Abhängigkeit von PFC-Pause weiter.
Multi-Path / Load BalancingAdaptive Routing in der Spezifikation integriert.Statisches ECMP, dazu DLB für adaptiven Single-Hop, GLB (OcNOS 7.1) für End-to-End und UEC-Packet-Spray für die nächste Generation.
Anbieter-ÖkosystemEffektiv Single-Vendor für NIC- und Switch-Silicon zugleich.Multi-Vendor auf jeder Ebene: ASIC, Switch, NIC, NOS, Optik. UEC ist explizit für herstellerneutrale Interoperabilität konzipiert.
BetriebsmodellSubnet Manager (UFM-Klasse). Anders als der Rest des DC. Separate Skills, separates Tooling.Dieselben BGP, EVPN, gNMI, die Sie bereits einsetzen. Dieselben Automatisierungstools (Ansible, NETCONF, OpenConfig) wie im übrigen DC.
Multi-tenancyEingeschränkt; Partitionierung existiert, ist aber kein First-Class-Konzept.Erstklassig über EVPN-VXLAN. GPU-as-a-Service, Multi-Team-Cluster, gemeinsam genutzte Infrastruktur, alles ganz natürlich.
Long-Haul-DCINicht dafür ausgelegt; benötigt IB-over-WAN-Gateways.Nativ über 400G ZR/ZR+ Coherent-Pluggables und EVPN Inter-DC.
Storage-KonvergenzStorage läuft neben Compute; benötigt IB-angebundenen Storage.NVMe-oF, NFS, S3 alle über dieselbe Ethernet-Fabric.
Kosten / Port (typisch 400G+)Premium; Single-Vendor-Preisgestaltung.Open-Hardware-Spine + OcNOS-DC-NOS unterbieten herstellergebundene Alternativen erheblich.
Roadmap-GeschwindigkeitBestimmt durch den Release-Takt eines einzigen Anbieters.Das UEC-Konsortium (AMD, Arista, Broadcom, Cisco, HPE, Intel, Meta, Microsoft, Oracle) treibt eine offen veröffentlichte Weiterentwicklung der Spezifikation voran.
Die Entscheidung

Wo jeweils die Stärken liegen

Die richtige Antwort ist workload-spezifisch. Wählen Sie InfiniBand, wo eine absolute Latenzuntergrenze gefordert ist; wählen Sie Ethernet, wo Betriebsmodell, Kosten oder die Reichweite über Standorte hinweg den Ausschlag geben.

Wählen Sie InfiniBand, wenn

Die Latenzuntergrenze ist vertraglich festgelegt

HPC-Simulation, bei der die absolute Latenzuntergrenze wichtiger ist als die Total Cost of Ownership, sowie eng gekoppelte, dedizierte Single-Tenant-Cluster, bei denen ein Lock-in akzeptabel ist.

Ethernet wählen, wenn

Das Betriebsmodell zählt

Mandantenfähiges GPU-as-a-Service und Cluster, die sich die Infrastruktur mit dem Rest des Rechenzentrums teilen, wo ein einziges Betriebsmodell, ein Tooling-Stack und eine Multi-Vendor-Lieferkette überzeugen.

Ethernet wählen, wenn

Die Kosten pro GPU-Flop sind entscheidend

Open-Hardware-Spines mit OcNOS-DC beseitigen den Single-Vendor-Aufpreis im Netzwerk. Bei einem Cluster mit mehreren Tausend GPUs ist das ein erheblicher Anteil des Hardware-Budgets.

Ethernet wählen, wenn

Die Fabric erstreckt sich über mehrere Rechenzentren

Wenn ein Trainingslauf jemals zwei Hallen oder zwei Regionen überspannt, machen kohärentes DCI, EVPN Inter-DC und standardisierte Multi-Vendor-Optik daraus eine Aufgabe von einem Tag statt eines quartalslangen Line-System-Projekts.

Wo sich die Lücke geschlossen hat

Was modernes Ethernet hinzugefügt hat

Drei Entwicklungen haben produktive KI-Fabrics auf Ethernet gebracht: echtes verlustfreies Verhalten, adaptives Routing, das Flows von überlasteten Uplinks fernhält, und ein Spray-freundlicher Transport der nächsten Generation.

Verlustfreies Verhalten

RoCEv2 with PFC, DCQCN und der PFC-Deadlock-Watchdog liefert den verlustfreien RDMA-Transport, den KI-Collectives benötigen, heute produktionsreif auf Standard-Ethernet.

Adaptives Routing

Statische ECMP-Kollisionen bei AI-Workloads sind real, aber DLB verteilt Flowlets bei lokaler Überlastung in Sub-Millisekunden-Fenstern neu, und GLB in OcNOS 7.1 erweitert das um ein Ende-zu-Ende-Path-Scoring.

Spray-freundlicher Transport

Ultra Ethernet (UEC 1.0, Juni 2025) bringt Packet Spray, Multi-Path-RDMA und Out-of-Order-Zustellung auf Standard-Ethernet. Bauen Sie jetzt auf RoCEv2 auf und halten Sie sich einen klaren Weg zu UEC offen, sobald die NICs verfügbar sind.

Das TCO-Gespräch

Das Netzwerk ist ein kleiner Posten, daher lohnt der Vergleich vor allem dort, wo es Mittel freisetzt

Über fünf Jahre macht die Switching-Ebene einen einstelligen Prozentsatz der Cluster-TCO aus, der steigt, sobald NICs, Optik und Verkabelung hinzukommen. Die sinnvolle Frage ist nicht der Posten selbst, sondern was das eingesparte Kapital finanziert.

  • Bei gleicher Kapazität ist Single-Vendor-InfiniBand mit einem Preisaufschlag gegenüber Open-Hardware-Ethernet verbunden.
  • Das eingesparte Kapital finanziert mehr GPUs, eine größere Storage-Ebene oder einen zweiten Standort für mehr Ausfallsicherheit.
  • Wo die Fabric mandantenfähig ist oder mit dem Rest des Rechenzentrums geteilt wird, ist ein einheitliches Netzwerkmodell mehr wert als der Kostenunterschied im Einzelposten.
Die Sichtweise von IP Infusion

Beide haben ihren Platz, und die meisten KI-Fabrics gehören auf Ethernet

Ethernet gewinnt nicht jeden Workload, doch die betrieblichen und wirtschaftlichen Argumente sind für die meisten entscheidend, und sie werden stärker, je weiter sich der technische Abstand schließt.

Beide haben ihren Platz

Ethernet gewinnt nicht jeden Workload. Eng gekoppelte HPC-Cluster mit Anforderungen an eine absolute Latenzuntergrenze bevorzugen weiterhin InfiniBand.

Die meisten KI-Fabrics gehören auf Ethernet

Produktives KI-Training und Inferenz im Hyperscale-Bereich wandern zu Ethernet, da die betrieblichen und wirtschaftlichen Argumente wachsen und sich der technische Abstand weiter schließt.

OcNOS-DC ist der offene Weg

RoCEv2 heute, DLB heute, GLB als Nächstes, UEC sobald NICs verfügbar sind. Ein NOS, eine Feature-Roadmap, auf validierter Open Hardware von Edgecore, UfiSpace und anderen.

FAQ

InfiniBand vs. Ethernet, beantwortet

Ist Ethernet für das AI-Training im Vergleich zu InfiniBand schnell genug?
Für die meisten verteilten Trainings-Collectives im großen Maßstab: ja. Ethernet hat eine um mehrere Hundert Nanosekunden höhere Latenzuntergrenze als InfiniBand, doch liegt diese unterhalb der Schwelle, die die meisten Workloads beeinflusst, sobald RoCEv2 mit PFC, DCQCN und DLB korrekt konfiguriert ist.
Wann sollte weiterhin InfiniBand gewählt werden?
Wählen Sie InfiniBand für eng gekoppelte HPC-Simulationen, bei denen die absolute Latenzuntergrenze wichtiger ist als die Total Cost of Ownership, sowie für geschlossene Single-Tenant-Cluster, in denen ein Single-Vendor-Lock-in akzeptabel ist.
Wann ist Ethernet für eine AI Fabric die bessere Wahl?
Ethernet setzt sich durch bei mandantenfähigem GPU-as-a-Service, bei Clustern, die ein Betriebsmodell und Tooling mit dem übrigen Data Center teilen, bei kostensensiblen Builds mit mehreren Tausend GPUs sowie bei Fabrics, die sich über coherent DCI und EVPN zwischen Data Centern erstrecken.
Wie schließt OcNOS die Lücke zu InfiniBand?
OcNOS-DC liefert heute RoCEv2-lossless-Transport, DLB-Adaptive-Routing und den PFC-Deadlock-Watchdog, GLB in 7.1 für End-to-End-Path-Scoring sowie UEC-Support, sobald die NICs verfügbar sind, alles auf validierter Open Hardware von Anbietern wie Edgecore und UfiSpace.
Ersetzen Hyperscaler InfiniBand durch Ethernet für KI?
Weitgehend ja, auch wenn InfiniBand nicht verschwindet. Laut Dell'Oro Group hat Ethernet InfiniBand im KI-Backend-(Scale-out-)Switching überholt und bis Anfang 2026 rund zwei Drittel des Marktes erreicht, gegenüber dem etwa 80-prozentigen Anteil von InfiniBand Ende 2023. Dell'Oro verweist zugleich auf ein starkes InfiniBand-Comeback im Zuge des NVIDIA Blackwell Ultra 800G-Hochlaufs, sodass es die Spezialistenwahl für eng gekoppeltes HPC bleibt. Meta hat beschrieben, seine größten Modelle über eine RoCE-Ethernet-Fabric auf einem von zwei 24,576-GPU-Clustern zu trainieren. Das Ultra Ethernet Consortium, zu dessen Steering-Mitgliedern AMD, Arista, Broadcom, Cisco, Eviden, HPE, Intel, Meta, Microsoft und Oracle zählen, standardisiert diese Richtung. Die Gründe sind betrieblicher und wirtschaftlicher Natur: ein Netzwerkmodell, das mit dem Rest des Rechenzentrums geteilt wird, eine Multi-Vendor-Lieferkette und geringere Kosten pro Port bei 400G und 800G.
Was ist die beste Alternative zu InfiniBand für die Vernetzung von KI-Clustern?
Ethernet mit RoCEv2 ist die verbreitete Alternative. Es transportiert RDMA verlustfrei mit PFC, ECN und DCQCN, ergänzt adaptives Routing über DLB und erhält durch Ultra Ethernet Packet Spray und Multi-Path-RDMA, sobald UEC-NICs verfügbar sind. Auf offener Hardware mit OcNOS-DC liefert es dies auf einem Multi-Vendor-Stack statt auf einer Single-Vendor-Fabric.
Worin unterscheiden sich Ultra Ethernet und InfiniBand?
Ultra Ethernet (UEC) bringt die Transporttechniken, die InfiniBand geprägt haben, auf Standard-Ethernet: Packet Spray über alle Pfade, Multi-Path-RDMA, Out-of-Order-Zustellung und selektive Neuübertragung. Die im Juni 2025 veröffentlichte UEC 1.0-Spezifikation definiert diesen Transport. Der Unterschied liegt im Ökosystem: InfiniBand ist bei NIC- und Switch-Silizium faktisch Single-Vendor, während Ultra Ethernet eine offene, herstellerübergreifende Spezifikation ist, die jeder Anbieter umsetzen kann.
Wie viel kostet eine Ethernet-KI-Fabric im Vergleich zu InfiniBand?
Die Switching-Ebene macht nur einen bescheidenen Anteil der Total Cost of Ownership eines KI-Clusters aus, über fünf Jahre meist einen einstelligen Prozentsatz, auch wenn dieser Wert steigt, sobald NICs, Optik und Verkabelung hinzukommen. Bei gleicher Kapazität ist Single-Vendor-InfiniBand in der Regel mit einem Preisaufschlag gegenüber Open-Hardware-Ethernet mit OcNOS-DC verbunden. Die nützlichere Frage ist, was das eingesparte Kapital finanziert, ob mehr GPUs, eine größere Storage-Ebene oder einen zweiten Standort für mehr Ausfallsicherheit.

Sie dimensionieren Ihren nächsten Cluster? Holen Sie sich eine workload-spezifische Bewertung

Nennen Sie uns den Workload und die GPU-Größenordnung, und ein IP Infusion-Ingenieur rechnet die Zahlen gemeinsam mit Ihnen durch, oder starten Sie mit einem ersten Leaf-Spine-Entwurf in der AI Fabric Design Suite.