RoCEv2 · DCQCN · DLB · UEC 1.0 ready

Eine offene 800G-AI-Fabric auf Standard-Ethernet

You can build a production GPU-cluster fabric on standard Ethernet and keep your NIC, GPU, and switch choices open. IP Infusion delivers that fabric complete: validated 800G open switches from Edgecore or UfiSpace running OcNOS-DC, supported under one contract. It carries lossless RoCEv2 RDMA with PFC, ECN-based congestion control (DCQCN), and sub-millisecond DLB in production today. IP Infusion ist ein beitragendes Mitglied des Ultra Ethernet Consortium, und OcNOS-DC ist ausgerichtet auf das Ultra Ethernet 1.0 fabric profile.

600+OcNOS-Netze im Produktivbetrieb
60+Länder im Einsatz
26 JahreRouting-Stack im Produktivbetrieb
Multi-
thousand
GPU-Referenzdesigns
The stakes

Was die Job-Abschlusszeit beeinflusst

Was im großen Maßstab zählt, ist, wie schnell Jobs abschließen und wie ausgelastet die GPUs bleiben, nicht der Switch-Durchsatz. Jedes Mal, wenn der Cluster zur Synchronisierung pausiert, verschwenden untätige GPUs Kapazität, sodass die Fabric nichts verwerfen darf und in dem Moment auf Congestion reagieren muss, in dem sie beginnt.

OcNOS-DC exposes every setting, so your team tunes the fabric against your real GPU collective traffic (xCCL: NCCL, RCCL, oneCCL) instead of accepting a vendor's fixed profile. Each pattern below is one way a cluster stalls, and how OcNOS-DC keeps it moving.

Trainings-Synchronisation (AllReduce)
Jede GPU kommuniziert gleichzeitig mit jeder anderen GPU
Standard-Load-Balancing bindet diese großen Flows an einen einzigen Uplink, sodass manche Links überlastet sind, während andere ungenutzt bleiben und die Synchronisation auf den langsamsten wartet.
DLB verlagert Flows in unter einer Millisekunde auf weniger ausgelastete Pfade.
GLB is on the OcNOS roadmap to balance across the whole fabric, not just the local hop.
Ergebnis: keine Traffic-Hotspots; der Synchronisationsschritt läuft nahezu mit voller Geschwindigkeit.
Traffic-Bursts (Incast)
Viele Sender treffen innerhalb von Mikrosekunden auf einen Port
Ein verworfenes Paket startet das gesamte Collective neu, und zu starkes Pausieren blockiert die Verbindung, daher muss die Fabric Überlast frühzeitig abwenden.
DCQCN bremst Sender frühzeitig ab, bevor etwas überläuft.
PFC watchdog löst einen blockierten Port eigenständig.
Ergebnis: Jobs überstehen Bursts, und ein blockierter Port erholt sich ohne manuellen Reset.
Scale-out (Multi-Rail)
Ein Flow benötigt alle parallelen Pfade gleichzeitig
Heute nimmt ein Flow einen einzigen Pfad, während die anderen Rails ungenutzt bleiben.
Ultra Ethernet (UEC 1.0) verteilt einen einzelnen Flow gleichzeitig über alle Pfade.
→ Der Switch, den Sie heute kaufen, bleibt beim Eintreffen von UEC-NICs weiter nutzbar, ohne Austausch.
Ergebnis: die langsamsten Übertragungen beschleunigen sich mit der Einführung von UEC-NICs.
90%+ target

Where the capacity goes. Static ECMP pins each large flow to one path, so elephant flows collide on a few uplinks while others sit idle. Dynamic load balancing rebinds flows on real-time congestion to keep every uplink busy, so a well-run AI fabric targets utilization in the 90% range on the same switches, with no extra uplinks. OcNOS-DC ships DLB on Tomahawk 4 and 5.

DLB Deep-Dive →
Reference topology

800G Spine-Leaf, verlustfrei von Ende zu Ende

Dies ist das Leaf-Spine-Design (Clos), das Ihr Team bereits kennt, gebaut, um GPU-Verkehr ohne Verluste zu betreiben: Ein geroutetes eBGP-Underlay verteilt den Verkehr gleichmäßig über jeden Pfad, verlustfreie Priority-Queues schützen die RoCEv2-Flows, und ein separates Management-Netz bringt die Switches hoch und streamt eigenständig Telemetrie. Leaf-angebundener NVMe-oF- und NFS-Speicher für Checkpoints und Datensätze liegt angrenzend an die GPU-Racks; siehe die DC-Fabric for storage-fabric detail. Hover any node for platform, port count, and chip.

AI-Fabric-Topologie: 800G Spine-Leaf mit parallelen Leaves, Full-Mesh-eBGP, einem isolierten Management-Bus und Leaf-angebundenem Storage
AI Fabric: 800G Spine-Leaf, Full-Mesh-eBGP, ein isolierter Management-Bus und Leaf-angebundener Storage.
Rail-optimized reference design

Every GPU NIC on its own rail, scaling across pods

In a rail-optimized fabric each GPU server homes one NIC to each of eight dedicated rail leaves, so the dominant same-rail AllReduce stays on one leaf and only cross-rail traffic reaches the spine. It scales pod by pod on the same 800G Tomahawk 5 switches. See the rail-optimized deep-dive and the full reference topologies.

Rail-optimized AI fabric topology: four 800G Tomahawk 5 spines above eight rail leaves, with four GPU servers each mapping one of its eight NICs to a different rail leaf, so intra-rail AllReduce stays on one leaf.
Rail-optimized single pod: each GPU server's 8 NICs map one per rail to 8 dedicated leaves, so same-rail AllReduce stays on the leaf and only cross-rail traffic reaches the spine.
Die Hardware

Validierte offene Switches

OcNOS-DC läuft auf Broadcom Tomahawk und Trident Switches von Edgecore und UfiSpace, sodass jede Plattform validiert, bestellbar und aus zweiter Quelle beziehbar ist.

Edgecore AIS800-64D 800G spine switch
Spine · Tomahawk 5

Edgecore AIS800-64D

64 x 800G · 51.2 Tbps

QSFP-DD800 · Breakout auf 2x400G / 4x200G / 8x100G

Datasheet →
UfiSpace S9321-64E 800G spine switch
Spine · Tomahawk 5

UfiSpace S9321-64E

64 x 800G · 51.2 Tbps

QSFP-DD800 · Breakout auf 2x400G / 4x200G / 8x100G

Datasheet →
Edgecore AS9736-64D 400G leaf switch
Leaf · Tomahawk 4

Edgecore AS9736-64D

64 x 400G · 25.6 Tbps

QSFP56-DD 400G · Breakout auf 4x100G / 4x25G · DAC / AOC

Datasheet →

Alle 40+ validierten Plattformen in der HCL ansehen →

Wie sich die Broadcom Tomahawk- und Trident-Familien unterscheiden und alle offenen Switches, auf denen OcNOS läuft →

Ein Anbieter für Software, Hardware und Support

SUPPORT AUS EINER HAND

Ein Vertrag, ein Ansprechpartner

Ein einziger IP Infusion Vertrag deckt die OcNOS-DC Software und die validierte Switch-Hardware gemeinsam ab, sodass es einen TAC und einen SLA gibt statt eines getrennten NOS- und Hardware-Anbieters. Ein 24/7 Support-Portal ist in den Tarifen Premium und Enterprise verfügbar.

Support-Details ansehen
IP MAESTRO MANAGEMENT

Eine Konsole für das Fabric

IP Maestro ist ein Element-Management-System für OcNOS: Topologie, Störungen, Konfiguration und Software-Images über jeden Switch hinweg via NETCONF, angesiedelt unterhalb Ihres bestehenden OSS. Verwaltet große Multi-Site-Flotten von einer Konsole aus.

IP Maestro erkunden
AUTOMATED DAY 2

Streaming-Telemetrie und Zero-Touch

gNMI-Streaming-Telemetrie speist Prometheus und Grafana, DCBX überträgt automatisch die korrekten verlustfreien Einstellungen an jeden Server, und Zero-Touch-Provisioning bringt Switches bereits beim Booten konfiguriert in Betrieb.

Automatisierung entdecken
Offene Alternative zu Spectrum-X

Die offene Multi-Vendor-Alternative zu NVIDIA Spectrum-X

OcNOS-DC betreibt eine verlustfreie RoCEv2-AI-Fabric auf Standard-Ethernet-Switches von mehr als einem Anbieter offener Hardware, unter einem einzigen Supportvertrag. Es passt zu den Fabric-Mechanismen, auf die ein AI-Trainingsjob angewiesen ist, und hält die Auswahl von NIC, GPU und Hardware offen, statt sie an einen einzigen Anbieter zu binden.

Offene AI-Fabric auf OcNOS-DC im Vergleich zu einem geschlossenen Single-Vendor-AI-Stack. Zuletzt verifiziert: Juli 2026.
Was den Ausschlag gibt Offene AI-Fabric (OcNOS-DC auf Edgecore / UfiSpace) Geschlossener Single-Vendor-Stack (NVIDIA Spectrum-X)
Hardware-Beschaffung Offenes Merchant-Silicon von mehr als einem Anbieter (Edgecore, UfiSpace) Switch, NIC und GPU aus einer Hand
Wahl von NIC und GPU Offen; NICs und GPUs unabhängig austauschbar An die NVIDIA NIC- und GPU-Roadmap gebunden
Verlustfreies RoCEv2 (PFC, ECN, DCQCN) details →
Adaptiver Lastausgleich sub-millisecond DLB flowlet rebinding details → (proprietary)
PFC-Deadlock-Schutz deadlock watchdog with auto-drain details →
Ultra Ethernet (UEC 1.0) tracks the UEC 1.0 fabric profile details → Aligned; also a UEC contributing member
Streaming-Telemetrie und Automatisierung gNMI, OpenConfig, ZTP, DCBX, Ansible (vendor pipeline)
Ein einziger Supportvertrag (Switch und Software) ein TAC, ein SLA (single vendor)
GPU-Silicon-Back-End-Integration Standard-Ethernet; kein GPU-Silicon-Co-Design Advantage NVIDIA: NIC, switch, and GPU co-designed
Fabric-Controller-Ebene Verwaltet über gNMI-Telemetrie und Ihr OSS oder IP Maestro Advantage NVIDIA: integrated fabric-controller layer
UEC certification Ausgerichtet am UEC-1.0-Fabric-Profil (keine Zertifizierungsaussage) NVIDIA ist ein UEC-Steuerungsmitglied

NVIDIA, Spectrum-X, Quantum und ConnectX sind Marken der NVIDIA Corporation. IP Infusion ist nicht mit NVIDIA verbunden und unterstützt NVIDIA nicht; der Vergleich spiegelt OcNOS-DC-Funktionen wider, die verifizierbar sind in der Feature-Matrix.

Die AI-Fabric-Landschaft 2026

Wo OcNOS-DC steht

Bis 2026 erfüllt nahezu jede Option dieselbe technische Messlatte: verlustfreies RoCEv2, Congestion Control, adaptives Routing, Ultra-Ethernet-Ausrichtung. Die Entscheidung läuft also hinaus auf die Ausgestaltung des Vertrags: ein offenes Betriebssystem oder ein geschlossener Stack, offene oder geschlossene Hardware, Standard-Ethernet oder geschlossenes InfiniBand. Here is where each one leaves you.

Lösungs-Shape Beispiele Kompromiss
Open NOS, AI-hardened, UEC-konform OcNOS-DC auf Edgecore / UfiSpace Dasselbe Broadcom-Silicon, dieselbe technische Basis. DCQCN abgestimmt auf RDMA-Collective-Traffic, DLB im Sub-Millisekundenbereich, GLB auf der OcNOS-Roadmap, PFC-Deadlock-Watchdog, UEC 1.0 Fabric-Profil. Support aus einer Hand. Kein NIC-, GPU- oder Hardware-Lock-in.
Geschlossener vertikaler AI-Stack NVIDIA Spectrum-X + Quantum + ConnectX Hervorragende integrierte Performance. NIC, Switch und Fabric-Software an einen einzelnen Anbieter gebunden, und an dessen GPU-Roadmap.
Geschlossenes Merchant-Silicon-NOS Arista EOS · Cisco NX-OS · Juniper Junos Darunter dasselbe Broadcom-Silizium. Aufpreis je Port-Lizenz. Telemetrie und Tuning auf die Pipeline des jeweiligen Anbieters beschränkt.
Zellbasierte proprietäre Chassis-Fabric DriveNets Network Cloud Andere Architektur: Scheduled Cell Fabric, kein Ethernet-NOS. Stark im Hyperscale-Bereich; nicht auf Standard-Switches übertragbar.
Closed-Loop-InfiniBand NVIDIA Quantum InfiniBand Heute niedrigste Latenz für eng gekoppelte Collectives. Separate Verkabelung, separater Betrieb, Single-Vendor-Ökosystem. UEC schließt die Lücke bei Ethernet.
Open NOS, ohne AI-Hardening Community SONiC Offene Hardware, freie Software, kein SLA. RDMA-abgestimmte DCQCN-Standardwerte, Deadlock-Watchdog und Tuning-Reife bleiben vollständig dem Betreiber überlassen.

Jede Option zielt auf eine andere Priorität ab. OcNOS-DC überzeugt mit offener Hardware, einer Komplettlösung und ohne Lock-in.

AI Fabric Dimensionierungsleitfaden

Dimensionieren Sie Ihr GPU-Fabric in wenigen Minuten

Geben Sie Ihre GPU-Anzahl und NIC-Geschwindigkeit ein. Die AI Fabric Design Suite bildet daraus eine Leaf-Spine-Topologie, Switch- und Portanzahlen sowie eine Stückliste ab, die Sie direkt für ein Angebot verwenden können. Keine Tabellenkalkulation erforderlich.

Häufige Fragen

Häufig gestellte Fragen

Ist OcNOS-DC wirklich "AI-native", oder einfach nur RoCEv2 mit Zusätzen?
Kein Merchant-Silicon-Ethernet-NOS ist im wörtlichen Sinne AI-nativ: keines verarbeitet xCCL (NCCL / RCCL / oneCCL) Collectives oder plant Jobs am Switch; das liegt in der NIC und im Scheduler. OcNOS-DC implementiert jeden Fabric-Mechanismus, den eine AI-Last von 2026 benötigt: verlustfreies RoCEv2, DCQCN-Buffer-Profile, abgestimmt auf RDMA-Collective-Verkehrsmuster, DLB-Flowlet-Rebinding im Submillisekunden-Bereich, PFC-Deadlock-Watchdog, UEC-1.0-Ausrichtung, und hält sich aus den darüberliegenden Schichten heraus. „AI-aware fabric“ bedeutet meist nur, dass ein Anbieter NIC + Switch + Scheduler als eine verriegelte SKU verkauft.
Wo endet OcNOS-DC und wo übernehmen NIC und Cluster-Scheduler?
OcNOS-DC verantwortet Layer 1: verlustfreien RDMA-Transport, Congestion Control, Adaptive Routing, Deadlock-Recovery, Telemetrie. Die NIC verantwortet Layer 2 (xCCL, RDMA-Verbs, Packet Spray, GPU-Direct Memory); der Scheduler verantwortet Layer 3 (Job Placement, Gradient-Sync-Fenster, Mandantentrennung). OcNOS-DC streamt gNMI-Telemetrie in Layer 3, beansprucht aber nie die Rolle des Schedulers: diese Trennung hält NIC, GPU und Orchestrierung austauschbar.
Wie schneidet OcNOS AI Fabric im Vergleich zu NVIDIA Spectrum-X, SONiC, Arista, Cisco oder DriveNets ab?
Spectrum-X is a closed NVIDIA NIC + switch + software stack: excellent performance, single-vendor lock-in. Arista, Cisco, and Juniper run similar RoCEv2 features on locked hardware with proprietary licensing. Community SONiC is open but ships no AI-hardened defaults, watchdog, or SLA. DriveNets DDC is a proprietary cell fabric, not an Ethernet NOS. OcNOS-DC delivers the complete system, validated open switches plus OcNOS-DC plus support under one contract, and runs one NOS across both service-provider and data-center roles. It runs on Broadcom silicon with lossless RoCEv2 (PFC, ECN, sub-millisecond DLB with Reactive Path Rebalance), PFC deadlock recovery, UEC 1.0 fabric-profile alignment, and a 24/7 SLA, with no lock-in.
Was bedeutet Ultra Ethernet (UEC) 1.0 für OcNOS AI Fabric?
Der Switch, den Sie heute kaufen, sollte weiterhin nutzbar sein, wenn Ultra Ethernet NICs eintreffen, und auf OcNOS-DC ist er es. Ihre Fabric betreibt schon jetzt voll unterstütztes RoCEv2 plus DCQCN plus DLB im Produktivbetrieb, und OcNOS-DC folgt dem UEC 1.0 Fabric-Profil, das jeden Flow über jeden Pfad parallelisiert, anstatt ihn auf einen einzigen ECMP-Hash festzulegen, sodass Sie ohne NOS- oder Hardware-Tausch auf UEC-NICs umsteigen. OcNOS-DC ist auf das UEC 1.0 Fabric-Profil ausgerichtet; die Ausrichtung ist keine Zertifizierungsaussage. Siehe die Ultra-Ethernet-Deep-Dive.
Was ist RoCEv2 und warum erfordert es ein verlustfreies Ethernet-Fabric?
Ihre Training-Collectives, AllReduce und AllGather, bewegen Daten GPU-zu-GPU über RoCEv2 ohne CPU im Pfad, und RDMA überträgt nie erneut, sodass ein einziges verlorenes Paket die Operation über jede GPU im Job neu startet. Deshalb benötigt produktives RoCEv2 eine wirklich verlustfreie Fabric (PFC plus ECN), und OcNOS-DC liefert die RoCEv2-Buffer-Profile und DCQCN-Voreinstellungen, abgestimmt auf RDMA-Collective-Verkehr, sodass Ihr Team dieses verlustfreie Verhalten nicht von Grund auf aufbauen muss.
How does OcNOS-DC keep the fabric lossless, and what protects against PFC deadlock?
Drei Mechanismen: PFC pausiert Datenverkehr je Priorität, bevor Puffer überlaufen; ECN markiert Pakete frühzeitig, um Sender zu drosseln; ETS hält RDMA-Flows vor niedriger priorisiertem Verkehr. Darüber liegt ein Deadlock-Watchdog je Port und je Priorität, der Zyklen pausierter Queues erkennt und die Queue automatisch leert, bevor Jobs hängen: bislang der Fehlerfall, der mitten im Lauf einen Power-Cycle des Switches erzwang. PFC over L3 wird über geroutete Grenzen hinweg unterstützt.
Was ist DLB, und was ist GLB auf der OcNOS-Roadmap?
Während AllReduce kollidieren Ihre größten Flows, wenn standardmäßiges ECMP jeden einzelnen für seine gesamte Lebensdauer an einen einzigen Uplink bindet, und die Synchronisation wartet auf die blockierte Verbindung. DLB liest live die ASIC-Queue-Depth-Telemetrie und bindet Flowlets in unter einer Millisekunde auf weniger ausgelastete Pfade um, sodass verlorener Durchsatz heute am lokalen Hop zurückgewonnen wird. GLB steht auf der OcNOS 7.x Roadmap, um dieselbe Idee fabricweit auszudehnen: Spines veröffentlichen Pfadqualitäts-Telemetrie zurück an die Ingress-Leaves, sodass das Routing den vollständigen Multi-Hop-Pfad über große Cluster mit mehreren Tausend GPUs bewertet.
Welche Skalierung unterstützt OcNOS AI Fabric, und welche Referenzdesigns sind qualifiziert?
OcNOS-DC unterstützt 400G- und 800G-Leaf-Spine-Fabrics. Tomahawk 5 Spines (Edgecore AIS800-64D, UfiSpace S9321-64E) liefern 51,2 Tbps / 64 × 800G; Tomahawk 4 leaves run 400G / 25.6 Tbps with on-chip buffering; Trident 4 covers smaller 100G/400G fabrics. Reference designs cover rail-only, rail-optimized, and 3-stage Clos topologies for large multi-thousand-GPU clusters: see the AI Fabric Topologies Deep-Dive.
Unterstützt OcNOS-DC Automatisierung und Telemetrie für den Betrieb von AI Fabrics?
Ja. DCBX automatisiert die RoCEv2-Konfiguration von Server zu Switch, ZTP (IPv4/IPv6) übernimmt das Zero-Touch-Onboarding, und gNMI streamt On-Change-Telemetrie über OpenConfig YANG. PFC-Pauses, ECN-Marking, DCQCN-Schwellenwerte und Buffer-Tiefen sind gNMI-Sensorpfade, die von Prometheus, InfluxDB, Telegraf, Grafana oder jeder OpenTelemetry-Pipeline nutzbar sind. Ansible-Playbooks decken Day-0 bis Day-2 ab, mit einem Terraform-Provider auf der Roadmap. IP Maestro, ein Element-Management-System für OcNOS, verwaltet Topologie, Fehler, Konfiguration und Software-Images über NETCONF und verwaltet große Multi-Site-Flotten von einer Konsole aus.
Welche Switch-Hardware und 800G-Optiken unterstützt das OcNOS AI Fabric?
The fabric runs on validated Broadcom Tomahawk 4 and 5 switches from Edgecore and UfiSpace. The 800G spines (Edgecore AIS800-64D and UfiSpace S9321-64E, Tomahawk 5, 64 x 800G QSFP-DD800, 51.2 Tbps) break out to 400G, 200G, and 100G; the 400G leaf (Edgecore AS9736-64D, Tomahawk 4, 64 x 400G QSFP56-DD, 25.6 Tbps with on-chip buffering) breaks out to 100G and 25G. Optics have proven interoperability from multiple vendors, so contact us for the transceiver list for your build. The switch platforms are listed in the HCL.
Wer bietet Support für das AI Fabric, und ist die Hardware ebenfalls abgedeckt?
Ein IP Infusion Vertrag deckt die OcNOS-DC Software und die validierte Switch-Hardware gemeinsam ab, sodass es einen TAC und einen SLA gibt. Der Support ist gestaffelt: Standard umfasst E-Mail-TAC, Telefonsupport zu Geschäftszeiten und Hardware-RMA-Koordination mit einer P1-Reaktionszeit von 8 Stunden; Premium ergänzt ein 24/7 Kundensupport-Portal und eine P1-Reaktionszeit von 2 Stunden; Enterprise ergänzt eine P1-Reaktionszeit von 30 Minuten sowie einen Customer Success Manager. Das 24/7 Portal ist in Premium und Enterprise verfügbar.