OcNOS AI Fabric: offenes, verlustfreies 800G-Ethernet für GPU-Cluster
OcNOS AI Fabric bringt Carrier-Grade-Networking in den GPU-Cluster: ein vollständiges verlustfreies Ethernet-System. IP Infusion liefert es komplett als OcNOS Systems: validierte offene 800G-Switches von Edgecore oder UfiSpace mit OcNOS-DC, unter einem Supportvertrag, wobei Ihre Wahl bei NIC, GPU und Switch offen bleibt. Es betreibt heute produktiv verlustfreies RoCEv2-RDMA mit PFC, ECN-basierter Überlastkontrolle (DCQCN) und DLB im Sub-Millisekunden-Bereich. IP Infusion ist Mitglied des Ultra Ethernet Consortium.
Architektur-Briefs herunterladen
Vier kurze Downloads, die tiefer gehen als diese Seite: die Architektur der verlustfreien AI-Fabric, das vollständige OcNOS-DC-Datenblatt, die EVPN-VXLAN-Rechenzentrumsreferenz und DCI der nächsten Generation mit IPoDWDM.
Ethernet-basierte verlustfreie 800G-AI-Fabric mit OcNOS
Non-Blocking-RoCEv2-Fabric auf Tomahawk-4/5-Spines: SKU-Stufen, qualifizierte Plattformen und Deployment-Architektur.
Brief anfordernEVPN-VXLAN-Data-Center-Fabric
Offene Leaf-Spine-Data-Center-Fabric: EVPN-Type-2- und Type-5-Routen, verteiltes Anycast-Gateway, mandantenfähige VNIs.
Brief anfordernDCI der nächsten Generation mit IPoDWDM
Sparen Sie die Transponder-Ebene ein: Betreiben Sie kohärente 400G/800G-ZR- und -ZR+-Optiken direkt vom Router aus für den Data-Center-Interconnect.
Brief anfordernOcNOS-DC-Datenblatt
Vollständige OcNOS-DC-Spezifikation: Funktionsumfang für EVPN-VXLAN und Ethernet for AI, Software-SKUs, unterstützte Hardware-Plattformen und der Solution Ordering Guide.
Datenblatt abrufenWas die Job-Abschlusszeit beeinflusst
Was im großen Maßstab zählt, ist, wie schnell Jobs abgeschlossen werden und wie ausgelastet die GPUs bleiben, nicht der Switch-Durchsatz. Jedes Mal, wenn der Cluster zur Synchronisierung pausiert, verschwenden untätige GPUs Kapazität, sodass die Fabric nichts verwerfen darf und in dem Moment auf Congestion reagieren muss, in dem sie beginnt.
OcNOS-DC legt jede Einstellung offen, sodass Ihr Team die Fabric anhand Ihres realen GPU-Collective-Traffics (xCCL: NCCL, RCCL, oneCCL) abstimmt, statt das feste Profil eines Anbieters zu übernehmen. Jedes Muster unten zeigt eine Art, wie ein Cluster ins Stocken gerät, und wie OcNOS-DC ihn in Bewegung hält.
→ DLB verlagert Flows in unter einer Millisekunde auf weniger ausgelastete Pfade.
→ GLB steht auf der OcNOS-Roadmap, um über die gesamte Fabric zu balancieren, nicht nur über den lokalen Hop.
→ DCQCN bremst Sender frühzeitig ab, bevor etwas überläuft.
→ PFC-Watchdog löst einen blockierten Port eigenständig.
→ DLB verlagert Flowlets auf der RoCEv2-Fabric, die Sie heute betreiben, weg von ausgelasteten Pfaden.
→ Ultra Ethernet (UEC) ist ein Multipath-Transport, der einen Flow von UEC-fähigen NICs aus über viele Pfade verteilt.
Wohin die Kapazität geht. Statisches ECMP bindet jeden großen Flow an einen Pfad, sodass Elephant Flows auf wenigen Uplinks kollidieren, während andere ungenutzt bleiben. Dynamic Load Balancing bindet Flows bei Überlast in Echtzeit neu, um jeden Uplink auszulasten, sodass eine gut betriebene AI-Fabric auf denselben Switches eine Auslastung im Bereich von 90 % anstrebt, ohne zusätzliche Uplinks. OcNOS-DC liefert DLB auf Tomahawk 4 und 5.
DLB im Detail →800G-Spine-Leaf, verlustfrei von Ende zu Ende
Dies ist das Leaf-Spine-Design (Clos), das Ihr Team bereits kennt, gebaut, um GPU-Verkehr ohne Verluste zu betreiben: Ein geroutetes eBGP-Underlay verteilt den Verkehr gleichmäßig über jeden Pfad, verlustfreie Priority-Queues schützen die RoCEv2-Flows, und ein separates Management-Netz nimmt die Switches in Betrieb und streamt eigenständig Telemetrie. Leaf-angebundener NVMe-oF- und NFS-Speicher für Checkpoints und Datensätze liegt angrenzend an die GPU-Racks; siehe die DC-Fabric für Details zur Storage-Fabric. Fahren Sie mit der Maus über einen Knoten, um Plattform, Portanzahl und Chip zu sehen.

Fahren Sie mit der Maus über die Knoten, um Details zu Funktionen und Plattformen zu sehen · Vollständige HCL: 40+ validierte Plattformen unter ipinfusion.com/hcl
Jeder GPU-NIC auf einem eigenen Rail, skalierbar über Pods hinweg
In einer rail-optimierten Fabric bindet jeder GPU-Server je einen NIC an jeden von acht dedizierten Rail-Leaves an, sodass der dominierende AllReduce-Traffic innerhalb eines Rails auf einem Leaf bleibt und nur Rail-übergreifender Traffic den Spine erreicht. Sie skaliert Pod für Pod auf denselben 800G-Tomahawk-5-Switches. Siehe den Deep-Dive zum Rail-optimierten Design und die vollständigen Referenztopologien.

Validierte offene Switches
OcNOS-DC läuft auf Broadcom-Tomahawk- und -Trident-Switches von Edgecore und UfiSpace, sodass jede Plattform validiert, bestellbar und aus zweiter Quelle beziehbar ist.

Edgecore AIS800-64D
64 x 800G · 51.2 Tbps
QSFP-DD800 · Breakout auf 2x400G / 4x200G / 8x100G

UfiSpace S9321-64E
64 x 800G · 51.2 Tbps
QSFP-DD800 · Breakout auf 2x400G / 4x200G / 8x100G

Edgecore AS9736-64D
64 x 400G · 25.6 Tbps
QSFP56-DD 400G · Breakout auf 4x100G / 4x25G · DAC / AOC
Alle 40+ validierten Plattformen in der HCL ansehen →
OcNOS Systems: ein Anbieter für Software, Hardware und Support
Ein Vertrag, ein Ansprechpartner
Als OcNOS Systems erworben, hat die Fabric einen einzigen Vertrag mit IP Infusion, der die OcNOS-DC-Software und die validierte Switch-Hardware gemeinsam abdeckt, sodass es einen TAC und ein SLA gibt statt eines getrennten NOS- und Hardware-Anbieters. Ein 24/7-Support-Portal ist in den Tarifen Premium und Enterprise verfügbar.
Support-Details ansehenEine Konsole für die Fabric
IP Maestro ist ein Element-Management-System für OcNOS: Topologie, Störungen, Konfiguration und Software-Images über jeden Switch hinweg via NETCONF, angesiedelt unterhalb Ihres bestehenden OSS. Verwaltet große Multi-Site-Flotten von einer Konsole aus.
IP Maestro erkundenStreaming-Telemetrie und Zero-Touch
gNMI-Streaming-Telemetrie speist Prometheus und Grafana, DCBX überträgt automatisch die korrekten verlustfreien Einstellungen an jeden Server, und Zero-Touch-Provisioning bringt Switches bereits beim Booten konfiguriert in Betrieb.
Automatisierung entdeckenDie offene Multi-Vendor-Alternative zu NVIDIA Spectrum-X
OcNOS-DC betreibt eine verlustfreie RoCEv2-AI-Fabric auf Standard-Ethernet-Switches von mehr als einem Anbieter offener Hardware, mit einem einzigen Supportvertrag beim Erwerb als OcNOS Systems. Es bietet die Fabric-Mechanismen, auf die ein AI-Trainingsjob angewiesen ist, und hält die Auswahl von NIC, GPU und Hardware offen, statt sie an einen einzigen Anbieter zu binden.
| Was den Ausschlag gibt | Offene AI-Fabric (OcNOS-DC auf Edgecore / UfiSpace) | Geschlossener NIC-plus-Switch-Stack |
|---|---|---|
| Hardware-Beschaffung | Offenes Merchant-Silicon von mehr als einem Anbieter (Edgecore, UfiSpace) | Switch, NIC und GPU aus einer Hand |
| Wahl von NIC und GPU | Offen; NICs und GPUs unabhängig austauschbar | An einen Anbieter für NIC- und GPU-Roadmap gebunden |
| Verlustfreies RoCEv2 (PFC, ECN, DCQCN) | ✓ Details → | ✓ |
| Adaptiver Lastausgleich | ✓ DLB-Flowlet-Neubindung im Sub-Millisekundenbereich Details → | ✓ (proprietär) |
| PFC-Deadlock-Schutz | ✓ Deadlock-Watchdog mit Auto-Drain Details → | ✓ |
| Streaming-Telemetrie und Automatisierung | ✓ gNMI, OpenConfig, ZTP, DCBX, Ansible | ✓ (Hersteller-Pipeline) |
| Ein einziger Supportvertrag (Switch und Software) | ✓ ein TAC, ein SLA mit OcNOS Systems | ✓ (ein Anbieter) |
| GPU-Silicon-Back-End-Integration | Standard-Ethernet; kein GPU-Silicon-Co-Design | NIC, Switch und GPU von einem Anbieter gemeinsam entwickelt |
| Fabric-Controller-Ebene | Verwaltet über gNMI-Telemetrie und Ihr OSS oder IP Maestro | Integrierte Fabric-Controller-Ebene des Anbieters |
NVIDIA und Spectrum-X sind Marken der NVIDIA Corporation. IP Infusion ist nicht mit NVIDIA verbunden und wird von NVIDIA nicht unterstützt; der Vergleich gibt Fähigkeiten von OcNOS-DC wieder, die überprüfbar sind in der Feature-Matrix.
Wo OcNOS-DC steht
OcNOS-DC erfüllt die technische Messlatte, die die meisten AI-Fabric-Optionen 2026 teilen: verlustfreies RoCEv2, Congestion Control und adaptives Routing. Die Entscheidung läuft also hinaus auf die Ausgestaltung des Vertrags: ein offenes Betriebssystem oder ein geschlossener Stack, offene oder geschlossene Hardware, Standard-Ethernet oder geschlossenes InfiniBand. Here is where each one leaves you.
Jede Option zielt auf eine andere Priorität ab. OcNOS-DC überzeugt mit offener Hardware, einer Komplettlösung und ohne Lock-in.
Dimensionieren Sie Ihre GPU-Fabric in wenigen Minuten
Geben Sie Ihre GPU-Anzahl und NIC-Geschwindigkeit ein. Die AI Fabric Design Suite bildet daraus eine Leaf-Spine-Topologie, Switch- und Portanzahlen sowie eine Stückliste ab, die Sie direkt für ein Angebot verwenden können. Keine Tabellenkalkulation erforderlich.
OcNOS über das gesamte Rechenzentrum erweitern
AI ist ein Segment des Rechenzentrums. Dasselbe OcNOS-Image erstreckt sich auf Compute, Storage und entfernte Standorte: dasselbe NOS, dieselbe CLI, derselbe Support.
Häufig gestellte Fragen
AI-Fabric-Referenzdesign
Kurzes Formular. Ihr PDF öffnet sich direkt nach dem Absenden.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
Ethernet-basierte verlustfreie 800G-AI-Fabric mit OcNOS
Kurzes Formular. Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
EVPN-VXLAN-Data-Center-Fabric
Kurzes Formular. Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
DCI der nächsten Generation mit IPoDWDM
Kurzes Formular. Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
OcNOS-DC-Datenblatt
Kurzes Formular. Ihr PDF wird unmittelbar nach dem Absenden heruntergeladen.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
AI-Fabric- & DC-Deployments
Produktive AI-Cluster und Data-Center-Fabrics, die OcNOS-DC auf Broadcom Tomahawk 4/5 betreiben.

NTT DATA ist eine Partnerschaft mit IP Infusion eingegangen, um Open-Networking-Lösungen auf den Markt zu bringen, mit OcNOS-basierten Cell-Site-Routern, Routed Optical…

Scott Data hat OcNOS mit Open-Networking-Hardware von UfiSpace, Edgecore Networks und Celestica implementiert und damit Legacy-Vendor-Stacks in seinem gesamten…

Madeo Consultant, ein in Frankreich ansässiger Rechenzentrums-Systemintegrator, hat Cisco-Nexus- und -Catalyst-Switches durch IP Infusion OcNOS auf Edgecore… ersetzt

Prosoluce, ein französischer ISP und Anbieter von Managed Services, rüstete seinen Core auf ein 100G-EVPN-VXLAN-Backbone mit IP Infusion OcNOS auf…
Passend aus dem Blog
Das AI Network Decision Framework: GPU-Fabric für Geschwindigkeit, ROI, strategische Freiheit
Framework auf Käuferseite für Entscheidungen zur GPU-Fabric mit RoCEv2 und offener Hardware
Beitrag lesen →OcNOS 7.0 für Rechenzentren: AI-Fabric, 800G-Plattformen, EVPN-VXLAN im großen Maßstab
800G-AI-Fabric-Features und Tomahawk-5-Plattformen, die in OcNOS 7.0 ausgeliefert werden
Beitrag lesen →OcNOS 7.0: Neuerungen für AI, Transport und Cloud
Hebt verlustfreien RoCEv2-Transport mit PFC für GPU-Cluster hervor
Beitrag lesen →OcNOS 6.6 für Rechenzentren: AI-Fabric-PFC/ETS, EVPN-Policy, 400G
Verlustfreie PFC/ETS-DCB-Features, die OcNOS-AI-Fabric-Deployments zugrunde liegen
Beitrag lesen →Die gesamte AI-Fabric mit OcNOS entwerfen
Vom Business Case bis zur Portanzahl-Berechnung: Steigen Sie dort ein, wo Sie beim Aufbau gerade stehen.
Möchten Sie, dass wir Sie kontaktieren?
Hinterlassen Sie Ihre Kontaktdaten, und ein Mitarbeiter des IP-Infusion-Teams unterstützt Sie gerne beim Design Ihrer AI-Fabric. Wir melden uns nur, wenn Sie es wünschen.