Eine offene 800G-AI-Fabric auf Standard-Ethernet
You can build a production GPU-cluster fabric on standard Ethernet and keep your NIC, GPU, and switch choices open. IP Infusion delivers that fabric complete: validated 800G open switches from Edgecore or UfiSpace running OcNOS-DC, supported under one contract. It carries lossless RoCEv2 RDMA with PFC, ECN-based congestion control (DCQCN), and sub-millisecond DLB in production today. IP Infusion ist ein beitragendes Mitglied des Ultra Ethernet Consortium, und OcNOS-DC ist ausgerichtet auf das Ultra Ethernet 1.0 fabric profile.
thousandGPU-Referenzdesigns
Architektur-Briefs herunterladen
Four short downloads that go deeper than this page: the lossless AI fabric architecture, the full OcNOS-DC datasheet, the EVPN-VXLAN data center reference, and next-generation DCI with IPoDWDM.
OcNOS 800G Ethernet-basierte verlustfreie AI Fabric
Non-Blocking-RoCEv2-Fabric auf Tomahawk-4/5-Spines: SKU-Stufen, qualifizierte Plattformen und Deployment-Architektur.
Brief anfordernEVPN-VXLAN Rechenzentrums-Fabric
Offenes Leaf-Spine-Rechenzentrums-Fabric: EVPN-Type-2- und Type-5-Routen, verteiltes Anycast-Gateway, mandantenfähige VNIs.
Brief anfordernDCI der nächsten Generation mit IPoDWDM
Reduzieren Sie die Transponder-Ebene: Betreiben Sie kohärente 400G/800G ZR und ZR+ Optiken direkt vom Router aus für den Data Center Interconnect.
Brief anfordernOcNOS-DC Datenblatt
Vollständige OcNOS-DC Spezifikation: Funktionsumfang für EVPN-VXLAN und Ethernet for AI, Software-SKUs, unterstützte Hardware-Plattformen und der Solution Ordering Guide.
Datasheet abrufenWas die Job-Abschlusszeit beeinflusst
Was im großen Maßstab zählt, ist, wie schnell Jobs abschließen und wie ausgelastet die GPUs bleiben, nicht der Switch-Durchsatz. Jedes Mal, wenn der Cluster zur Synchronisierung pausiert, verschwenden untätige GPUs Kapazität, sodass die Fabric nichts verwerfen darf und in dem Moment auf Congestion reagieren muss, in dem sie beginnt.
OcNOS-DC exposes every setting, so your team tunes the fabric against your real GPU collective traffic (xCCL: NCCL, RCCL, oneCCL) instead of accepting a vendor's fixed profile. Each pattern below is one way a cluster stalls, and how OcNOS-DC keeps it moving.
→ DLB verlagert Flows in unter einer Millisekunde auf weniger ausgelastete Pfade.
→ GLB is on the OcNOS roadmap to balance across the whole fabric, not just the local hop.
→ DCQCN bremst Sender frühzeitig ab, bevor etwas überläuft.
→ PFC watchdog löst einen blockierten Port eigenständig.
→ Ultra Ethernet (UEC 1.0) verteilt einen einzelnen Flow gleichzeitig über alle Pfade.
→ Der Switch, den Sie heute kaufen, bleibt beim Eintreffen von UEC-NICs weiter nutzbar, ohne Austausch.
Where the capacity goes. Static ECMP pins each large flow to one path, so elephant flows collide on a few uplinks while others sit idle. Dynamic load balancing rebinds flows on real-time congestion to keep every uplink busy, so a well-run AI fabric targets utilization in the 90% range on the same switches, with no extra uplinks. OcNOS-DC ships DLB on Tomahawk 4 and 5.
DLB Deep-Dive →800G Spine-Leaf, verlustfrei von Ende zu Ende
Dies ist das Leaf-Spine-Design (Clos), das Ihr Team bereits kennt, gebaut, um GPU-Verkehr ohne Verluste zu betreiben: Ein geroutetes eBGP-Underlay verteilt den Verkehr gleichmäßig über jeden Pfad, verlustfreie Priority-Queues schützen die RoCEv2-Flows, und ein separates Management-Netz bringt die Switches hoch und streamt eigenständig Telemetrie. Leaf-angebundener NVMe-oF- und NFS-Speicher für Checkpoints und Datensätze liegt angrenzend an die GPU-Racks; siehe die DC-Fabric for storage-fabric detail. Hover any node for platform, port count, and chip.

Fahren Sie über die Knoten, um Details zu Funktionen und Plattformen zu sehen · Vollständige HCL: 40+ validierte Plattformen unter ipinfusion.com/hcl
Every GPU NIC on its own rail, scaling across pods
In a rail-optimized fabric each GPU server homes one NIC to each of eight dedicated rail leaves, so the dominant same-rail AllReduce stays on one leaf and only cross-rail traffic reaches the spine. It scales pod by pod on the same 800G Tomahawk 5 switches. See the rail-optimized deep-dive and the full reference topologies.

Validierte offene Switches
OcNOS-DC läuft auf Broadcom Tomahawk und Trident Switches von Edgecore und UfiSpace, sodass jede Plattform validiert, bestellbar und aus zweiter Quelle beziehbar ist.

Edgecore AIS800-64D
64 x 800G · 51.2 Tbps
QSFP-DD800 · Breakout auf 2x400G / 4x200G / 8x100G
Datasheet →
UfiSpace S9321-64E
64 x 800G · 51.2 Tbps
QSFP-DD800 · Breakout auf 2x400G / 4x200G / 8x100G
Datasheet →
Edgecore AS9736-64D
64 x 400G · 25.6 Tbps
QSFP56-DD 400G · Breakout auf 4x100G / 4x25G · DAC / AOC
Datasheet →Alle 40+ validierten Plattformen in der HCL ansehen →
Ein Anbieter für Software, Hardware und Support
Ein Vertrag, ein Ansprechpartner
Ein einziger IP Infusion Vertrag deckt die OcNOS-DC Software und die validierte Switch-Hardware gemeinsam ab, sodass es einen TAC und einen SLA gibt statt eines getrennten NOS- und Hardware-Anbieters. Ein 24/7 Support-Portal ist in den Tarifen Premium und Enterprise verfügbar.
Support-Details ansehenEine Konsole für das Fabric
IP Maestro ist ein Element-Management-System für OcNOS: Topologie, Störungen, Konfiguration und Software-Images über jeden Switch hinweg via NETCONF, angesiedelt unterhalb Ihres bestehenden OSS. Verwaltet große Multi-Site-Flotten von einer Konsole aus.
IP Maestro erkundenStreaming-Telemetrie und Zero-Touch
gNMI-Streaming-Telemetrie speist Prometheus und Grafana, DCBX überträgt automatisch die korrekten verlustfreien Einstellungen an jeden Server, und Zero-Touch-Provisioning bringt Switches bereits beim Booten konfiguriert in Betrieb.
Automatisierung entdeckenDie offene Multi-Vendor-Alternative zu NVIDIA Spectrum-X
OcNOS-DC betreibt eine verlustfreie RoCEv2-AI-Fabric auf Standard-Ethernet-Switches von mehr als einem Anbieter offener Hardware, unter einem einzigen Supportvertrag. Es passt zu den Fabric-Mechanismen, auf die ein AI-Trainingsjob angewiesen ist, und hält die Auswahl von NIC, GPU und Hardware offen, statt sie an einen einzigen Anbieter zu binden.
| Was den Ausschlag gibt | Offene AI-Fabric (OcNOS-DC auf Edgecore / UfiSpace) | Geschlossener Single-Vendor-Stack (NVIDIA Spectrum-X) |
|---|---|---|
| Hardware-Beschaffung | Offenes Merchant-Silicon von mehr als einem Anbieter (Edgecore, UfiSpace) | Switch, NIC und GPU aus einer Hand |
| Wahl von NIC und GPU | Offen; NICs und GPUs unabhängig austauschbar | An die NVIDIA NIC- und GPU-Roadmap gebunden |
| Verlustfreies RoCEv2 (PFC, ECN, DCQCN) | ✓ details → | ✓ |
| Adaptiver Lastausgleich | ✓ sub-millisecond DLB flowlet rebinding details → | ✓ (proprietary) |
| PFC-Deadlock-Schutz | ✓ deadlock watchdog with auto-drain details → | ✓ |
| Ultra Ethernet (UEC 1.0) | ✓ tracks the UEC 1.0 fabric profile details → | Aligned; also a UEC contributing member |
| Streaming-Telemetrie und Automatisierung | ✓ gNMI, OpenConfig, ZTP, DCBX, Ansible | ✓ (vendor pipeline) |
| Ein einziger Supportvertrag (Switch und Software) | ✓ ein TAC, ein SLA | ✓ (single vendor) |
| GPU-Silicon-Back-End-Integration | Standard-Ethernet; kein GPU-Silicon-Co-Design | Advantage NVIDIA: NIC, switch, and GPU co-designed |
| Fabric-Controller-Ebene | Verwaltet über gNMI-Telemetrie und Ihr OSS oder IP Maestro | Advantage NVIDIA: integrated fabric-controller layer |
| UEC certification | Ausgerichtet am UEC-1.0-Fabric-Profil (keine Zertifizierungsaussage) | NVIDIA ist ein UEC-Steuerungsmitglied |
NVIDIA, Spectrum-X, Quantum und ConnectX sind Marken der NVIDIA Corporation. IP Infusion ist nicht mit NVIDIA verbunden und unterstützt NVIDIA nicht; der Vergleich spiegelt OcNOS-DC-Funktionen wider, die verifizierbar sind in der Feature-Matrix.
Wo OcNOS-DC steht
Bis 2026 erfüllt nahezu jede Option dieselbe technische Messlatte: verlustfreies RoCEv2, Congestion Control, adaptives Routing, Ultra-Ethernet-Ausrichtung. Die Entscheidung läuft also hinaus auf die Ausgestaltung des Vertrags: ein offenes Betriebssystem oder ein geschlossener Stack, offene oder geschlossene Hardware, Standard-Ethernet oder geschlossenes InfiniBand. Here is where each one leaves you.
Jede Option zielt auf eine andere Priorität ab. OcNOS-DC überzeugt mit offener Hardware, einer Komplettlösung und ohne Lock-in.
Dimensionieren Sie Ihr GPU-Fabric in wenigen Minuten
Geben Sie Ihre GPU-Anzahl und NIC-Geschwindigkeit ein. Die AI Fabric Design Suite bildet daraus eine Leaf-Spine-Topologie, Switch- und Portanzahlen sowie eine Stückliste ab, die Sie direkt für ein Angebot verwenden können. Keine Tabellenkalkulation erforderlich.
OcNOS über das gesamte Rechenzentrum erweitern
AI ist ein Segment des Rechenzentrums. Dasselbe OcNOS-Image erstreckt sich auf Compute, Storage und entfernte Standorte: dasselbe NOS, dieselbe CLI, derselbe Support.
Häufig gestellte Fragen
AI-Fabric-Referenzdesign
Quick form. Your PDF opens immediately after submit.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
OcNOS 800G Ethernet-basierte verlustfreie AI Fabric
Kurzes Formular. Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
EVPN-VXLAN Rechenzentrums-Fabric
Kurzes Formular. Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
DCI der nächsten Generation mit IPoDWDM
Kurzes Formular. Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
OcNOS-DC Datenblatt
Kurzes Formular. Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
AI-Fabric- & DC-Deployments
Produktive AI-Cluster und Data-Center-Fabrics, die OcNOS-DC auf Broadcom Tomahawk 4/5 betreiben.

NTT DATA ist eine Partnerschaft mit IP Infusion eingegangen, um disaggregierte Open-Networking-Lösungen auf den Markt zu bringen, und bietet OcNOS-basierte Cell Site Router, Routed…

Scott Data hat OcNOS mit Open-Networking-Hardware von UfiSpace, Edgecore Networks und Celestica implementiert und damit Legacy-Vendor-Stacks in seinem gesamten…

Madeo Consultant, ein in Frankreich ansässiger Rechenzentrums-Systemintegrator, hat Cisco Nexus- und Catalyst-Switches durch IP Infusion OcNOS auf Edgecore… ersetzt

Prosoluce, ein französischer ISP und Anbieter von Managed Services, rüstete seinen Core auf ein 100G-EVPN-VXLAN-Backbone mit IP Infusion OcNOS auf…
Passend aus dem Blog
Das AI Network Decision Framework: GPU-Fabric für Geschwindigkeit, ROI, strategische Freiheit
Framework auf Käuferseite für Entscheidungen zur GPU-Fabric mit RoCEv2 und offener Hardware
Beitrag lesen →OcNOS 7.0 für Rechenzentren: AI Fabric, 800G-Plattformen, EVPN-VXLAN im großen Maßstab
800G-AI-Fabric-Features und Tomahawk-5-Plattformen, die in OcNOS 7.0 ausgeliefert werden
Beitrag lesen →OcNOS 7.0: What's New for AI, Transport, and Cloud
Hebt verlustfreien RoCEv2-Transport mit PFC für GPU-Cluster hervor
Beitrag lesen →OcNOS 6.6 für Rechenzentren: AI Fabric PFC/ETS, EVPN Policy, 400G
Verlustfreie PFC/ETS-DCB-Features, die OcNOS-AI-Fabric-Deployments zugrunde liegen
Beitrag lesen →Die gesamte KI-Fabric mit OcNOS entwerfen
Vom Business Case bis zur Portanzahl-Berechnung: Steigen Sie dort ein, wo Sie beim Aufbau gerade stehen.
Möchten Sie, dass wir Sie kontaktieren?
Hinterlassen Sie Ihre Kontaktdaten, und ein Mitarbeiter des IP Infusion Teams unterstützt Sie gerne beim Design Ihrer KI-Fabric. Wir melden uns nur, wenn Sie es wünschen.