Networking für die Neocloud: ein Fabric für KI-Training und -Inferenz
Eine Neocloud betreibt Training und Inferenz auf derselben Infrastruktur. IP Infusion liefert das offene Netzwerk für beides: OcNOS auf validierter offener Hardware, verlustfreies RoCEv2 für GPU-Cluster, verteilte Inferenz am Edge und offener Transport zwischen Standorten, aus einer Control Plane und mit einem Supportvertrag.
Training und Inferenz ziehen das Netzwerk in entgegengesetzte Richtungen
Jede Neocloud bedient beide. Training füllt einige wenige große Cluster mit gleichmäßigem, synchronisiertem Verkehr. Inferenz verteilt sich auf viele Standorte und schnellt ohne Vorwarnung nach oben. Das Fabric muss beiden gerecht werden, sonst wandern die Workloads, die das Geld bringen, woanders hin.
| Was das Netzwerk sieht | Trainingdie KI-Fabrik | Inferenzder Echtzeitdienst |
|---|---|---|
| Ausdehnung | Wenige große GPU-Cluster | Viele regionale und Edge-Standorte |
| Datenverkehr | Massenhafter, synchronisierter GPU-zu-GPU-Collective-Verkehr | Kleine, latenzkritische Anfragen |
| Lastprofil | Dauerhafte, nahezu volle GPU-Auslastung über lange Läufe | Stoßweise und elastisch, Spitzen in Sekunden |
| Das Netzwerk muss sein | Verlustfrei bei anhaltender Bandbreite | Niedrige Latenz und Redundanz auf jeder Ebene |
| Fehlertoleranz | Tolerant, Jobs setzen Checkpoints und werden fortgesetzt | Gering, strenge SLAs bei jeder Anfrage |
Ein Fabric oder zwei?
Jede Neocloud beantwortet dieselbe Frage: Wie viele Netzwerke baut sie, um Training und Inferenz zu bedienen? Die Antwort prägt die Kostenbasis über die gesamte Laufzeit des Ausbaus.
Ein Trainingsnetzwerk plus ein zweites für die Inferenz
Ein Fabric für Training, ein anderes für Inferenz angesetzt. Zwei Designs, zwei Ersatzteillager, zwei Betriebsteams, zwei Upgrade-Zyklen. Kapital- und Betriebskosten verdoppeln sich, bevor der erste Kunde kommt, und die Marge muss alles davon auffangen.
Training und Inferenz auf einer Control Plane
Beide Workloads laufen im selben OcNOS-Netzwerk. Ein Image, eine Control Plane, ein Supportvertrag. Das Trainings-Fabric und die verteilten Inferenzstandorte sind dieselbe Plattform, pro Rolle dimensioniert und lizenziert, sodass der Betreiber Training und jede folgende Inferenz-Workload auf der Infrastruktur erfasst, die er bereits besitzt.

Ein verlustfreies Ethernet-Fabric für die GPU-Cluster
Training bewegt massiven, synchronisierten Verkehr zwischen GPUs, daher muss das Fabric unter Last verlustfrei bleiben. OcNOS betreibt das RoCEv2-Toolkit auf offener Merchant-Silicon-Hardware mit bis zu 800G, sodass die KI-Fabrik ein Ethernet-Fabric mit hoher Radix ohne Single-Vendor-Stack erhält.
Verlustfreies RoCEv2
Priority flow control, ECN, and DCQCN halten GPU-Collective-Traffic frei von Paketverlust, mit adaptivem Load Balancing zur Verteilung über das Fabric.
Bis zu 800G auf offenem Silicon
Ethernet mit hoher Radix auf validierter offener Hardware von mehreren Anbietern trägt das Trainings-Fabric, mit Reserven, um den Cluster zu erweitern.
Bereit für den GPU-Stack
Das Fabric trägt die GPU collective libraries (NCCL, RCCL, oneCCL) , auf denen Trainingsjobs laufen, sodass das Netzwerk beim AllReduce nicht zum Engpass wird.
Dasselbe OcNOS-Image läuft auf jeder Stufe, sodass das Fabric mit dem Cluster mitskaliert, statt bei jedem Schritt neu entworfen zu werden.
Inferenz lebt am Edge und braucht ein Netzwerk, das mitzieht
Inferenz verteilt sich auf viele regionale und Edge-Standorte, skaliert schnell hoch und runter und hält enge Latenzziele ein. Hier braucht eine Neocloud mehr als ein Rechenzentrums-Fabric: Sie braucht Transport zwischen den Standorten und Assurance über alle hinweg. IP Infusion deckt den gesamten Pfad ab.
Rechenzentrums-Fabric an jedem Standort
An EVPN-VXLAN Leaf-Spine Fabric auf offenen Switches bedient jeden Inferenzstandort, mit der Elastizität, Kapazität je nach Nachfrage hinzuzufügen und zu entfernen.
Offener Transport zwischen Standorten
Transport mit niedriger Latenz verbindet die Standorte. IP over DWDM with coherent ZR and ZR+ führt die optische Schicht auf dem Router zusammen, für Kapazität von Standort zu Standort.
Assurance über jeden Standort
IP Maestro gibt einen einzigen Blick auf das gesamte Netz, sodass ein Betreiber Inferenz-Service-Level über viele Standorte und N+1-Designs hinweg einhält.
Eine Kostenbasis, die eine Neocloud verteidigen kann
Eine Neocloud konkurriert über Preis und Skalierungsgeschwindigkeit, daher darf das Netzwerk keine proprietäre Steuer sein. Open Networking gibt dem Betreiber die Kontrolle über Hardware, Software und Lieferzeiten, während ein Anbieter weiterhin für Software und Support verantwortlich ist.
Multi-Vendor-Lieferkette
Switches from Edgecore, UfiSpace und anderen führen dasselbe OcNOS-Image aus, sodass der Betreiber bei Hardware oder Lieferzeiten nie an einen Anbieter gebunden ist.
Geringere Hardwarekosten
OcNOS auf offenen Merchant-Silicon-Switches trägt das AI Fabric zu 40 bis 60 % geringeren Hardwarekosten als proprietäre Plattformen bei vergleichbaren Portgeschwindigkeiten und vergleichbarem Radix.
Ein Anbieter verantwortet die Lösung
Hardware und Software werden in unabhängigen Zyklen erneuert, aber ein Supportvertrag deckt das komplette System ab, sodass ein Team die Lösung verantwortet.
Das offene Netzwerk läuft bereits im großen Maßstab
Das Neocloud-Fabric ist keine Laborübung. Es läuft mit demselben OcNOS, das weltweit für Betreiber Produktivverkehr trägt, auf derselben offenen Hardware.
Neocloud-Networking, beantwortet
Was ist eine Neocloud?
Nutzen Neoclouds InfiniBand oder Ethernet?
Sollte eine Neocloud ein oder zwei Netzwerke für Training und Inferenz bauen?
Wann braucht eine Neocloud doch zwei getrennte Netzwerke?
Was braucht verteilte Inferenz vom Netzwerk?
Wie senkt Open Networking die Kosten einer Neocloud?
Nehmen Sie das OcNOS-DC-Datenblatt mit
Ein kurzer, technischer Download, der über diese Seite hinausgeht: das vollständige OcNOS-DC-Datenblatt.
OcNOS-DC Datenblatt
Kurzes Formular. Ihr PDF öffnet sich unmittelbar nach dem Absenden in einem neuen Tab.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
Gestalten Sie Ihr Neocloud-Fabric mit einer Control Plane
Nennen Sie uns die GPU-Größenordnung und die Standorte, die Sie bedienen möchten, und ein IP-Infusion-Techniker hilft Ihnen, ein offenes Fabric für Training und Inferenz zu entwerfen.
Möchten Sie, dass wir Sie kontaktieren?
Hinterlassen Sie Ihre Angaben, und ein IP-Infusion-Techniker hilft Ihnen, ein offenes Fabric für KI-Training und -Inferenz zu entwerfen. Wir melden uns nur, wenn Sie es wünschen.