Neocloud · AI training and inference

Networking für die Neocloud: ein Fabric für KI-Training und -Inferenz

Eine Neocloud betreibt Training und Inferenz auf derselben Infrastruktur. IP Infusion liefert das offene Netzwerk für beides: OcNOS auf validierter offener Hardware, verlustfreies RoCEv2 für GPU-Cluster, verteilte Inferenz am Edge und offener Transport zwischen Standorten, aus einer Control Plane und mit einem Supportvertrag.

1 FabricTraining und Inferenz
bis zu 800GEthernet-AI-Fabric
40 bis 60 %geringere Hardwarekosten
600+Betreibernetze
Zwei Workloads, ein Geschäft

Training und Inferenz ziehen das Netzwerk in entgegengesetzte Richtungen

Jede Neocloud bedient beide. Training füllt einige wenige große Cluster mit gleichmäßigem, synchronisiertem Verkehr. Inferenz verteilt sich auf viele Standorte und schnellt ohne Vorwarnung nach oben. Das Fabric muss beiden gerecht werden, sonst wandern die Workloads, die das Geld bringen, woanders hin.

Training und Inferenz im Vergleich, nach den Netzwerkmetriken, die das Fabric prägen.
Was das Netzwerk sieht Trainingdie KI-Fabrik Inferenzder Echtzeitdienst
AusdehnungWenige große GPU-ClusterViele regionale und Edge-Standorte
DatenverkehrMassenhafter, synchronisierter GPU-zu-GPU-Collective-VerkehrKleine, latenzkritische Anfragen
LastprofilDauerhafte, nahezu volle GPU-Auslastung über lange LäufeStoßweise und elastisch, Spitzen in Sekunden
Das Netzwerk muss seinVerlustfrei bei anhaltender BandbreiteNiedrige Latenz und Redundanz auf jeder Ebene
FehlertoleranzTolerant, Jobs setzen Checkpoints und werden fortgesetztGering, strenge SLAs bei jeder Anfrage
Die Netzwerkentscheidung, die Ihre Marge bestimmt

Ein Fabric oder zwei?

Jede Neocloud beantwortet dieselbe Frage: Wie viele Netzwerke baut sie, um Training und Inferenz zu bedienen? Die Antwort prägt die Kostenbasis über die gesamte Laufzeit des Ausbaus.

Option A · two networks

Ein Trainingsnetzwerk plus ein zweites für die Inferenz

Ein Fabric für Training, ein anderes für Inferenz angesetzt. Zwei Designs, zwei Ersatzteillager, zwei Betriebsteams, zwei Upgrade-Zyklen. Kapital- und Betriebskosten verdoppeln sich, bevor der erste Kunde kommt, und die Marge muss alles davon auffangen.

Verdoppelte Capex und Opex, Marge unter Druck
Option B · one OcNOS fabric

Training und Inferenz auf einer Control Plane

Beide Workloads laufen im selben OcNOS-Netzwerk. Ein Image, eine Control Plane, ein Supportvertrag. Das Trainings-Fabric und die verteilten Inferenzstandorte sind dieselbe Plattform, pro Rolle dimensioniert und lizenziert, sodass der Betreiber Training und jede folgende Inferenz-Workload auf der Infrastruktur erfasst, die er bereits besitzt.

Ein Fabric, Kosten, die mit dem Geschäft skalieren
Ein OcNOS-Fabric für eine Neocloud: links ein Leaf-Spine-GPU-Trainingscluster mit verlustfreiem RoCEv2 bei bis zu 800G, rechts verteilte Inferenzstandorte, verbunden durch offenen IP-over-DWDM-Transport, alles unter einer OcNOS-Control-Plane.
Ein OcNOS-Fabric für Training und Inferenz: ein verlustfreier RoCEv2-GPU-Trainingscluster, verteilte Inferenzstandorte und offener Transport dazwischen, unter einer Control Plane.
Das Trainings-Fabric

Ein verlustfreies Ethernet-Fabric für die GPU-Cluster

Training bewegt massiven, synchronisierten Verkehr zwischen GPUs, daher muss das Fabric unter Last verlustfrei bleiben. OcNOS betreibt das RoCEv2-Toolkit auf offener Merchant-Silicon-Hardware mit bis zu 800G, sodass die KI-Fabrik ein Ethernet-Fabric mit hoher Radix ohne Single-Vendor-Stack erhält.

Verlustfreies RoCEv2

Priority flow control, ECN, and DCQCN halten GPU-Collective-Traffic frei von Paketverlust, mit adaptivem Load Balancing zur Verteilung über das Fabric.

Bis zu 800G auf offenem Silicon

Ethernet mit hoher Radix auf validierter offener Hardware von mehreren Anbietern trägt das Trainings-Fabric, mit Reserven, um den Cluster zu erweitern.

Bereit für den GPU-Stack

Das Fabric trägt die GPU collective libraries (NCCL, RCCL, oneCCL) , auf denen Trainingsjobs laufen, sodass das Netzwerk beim AllReduce nicht zum Engpass wird.

Ein Image, jede Skalierungsstufe
Rack
GPU-Server + Leaf
Die Einheit, in der Sie Kapazität hinzufügen: GPU-Server hinter einem Top-of-Rack-Leaf.
Pod
Leaf-Spine-Block
Ein nicht blockierender Leaf-Spine-Block, der wiederholbare Baustein des Fabric.
Cluster
Bis zu 4,096 GPUs
Ein vollständiger Trainingscluster auf einem verlustfreien RoCEv2-Fabric.
Multi-Cluster
Designs mit 16,384 GPUs
Mehrere Cluster plus verteilte Inferenzstandorte, unter einer Control Plane.

Dasselbe OcNOS-Image läuft auf jeder Stufe, sodass das Fabric mit dem Cluster mitskaliert, statt bei jedem Schritt neu entworfen zu werden.

Verteilte Inferenz

Inferenz lebt am Edge und braucht ein Netzwerk, das mitzieht

Inferenz verteilt sich auf viele regionale und Edge-Standorte, skaliert schnell hoch und runter und hält enge Latenzziele ein. Hier braucht eine Neocloud mehr als ein Rechenzentrums-Fabric: Sie braucht Transport zwischen den Standorten und Assurance über alle hinweg. IP Infusion deckt den gesamten Pfad ab.

Rechenzentrums-Fabric an jedem Standort

An EVPN-VXLAN Leaf-Spine Fabric auf offenen Switches bedient jeden Inferenzstandort, mit der Elastizität, Kapazität je nach Nachfrage hinzuzufügen und zu entfernen.

Offener Transport zwischen Standorten

Transport mit niedriger Latenz verbindet die Standorte. IP over DWDM with coherent ZR and ZR+ führt die optische Schicht auf dem Router zusammen, für Kapazität von Standort zu Standort.

Assurance über jeden Standort

IP Maestro gibt einen einzigen Blick auf das gesamte Netz, sodass ein Betreiber Inferenz-Service-Level über viele Standorte und N+1-Designs hinweg einhält.

Offene Hardware, geringere Kosten

Eine Kostenbasis, die eine Neocloud verteidigen kann

Eine Neocloud konkurriert über Preis und Skalierungsgeschwindigkeit, daher darf das Netzwerk keine proprietäre Steuer sein. Open Networking gibt dem Betreiber die Kontrolle über Hardware, Software und Lieferzeiten, während ein Anbieter weiterhin für Software und Support verantwortlich ist.

Multi-Vendor-Lieferkette

Switches from Edgecore, UfiSpace und anderen führen dasselbe OcNOS-Image aus, sodass der Betreiber bei Hardware oder Lieferzeiten nie an einen Anbieter gebunden ist.

Geringere Hardwarekosten

OcNOS auf offenen Merchant-Silicon-Switches trägt das AI Fabric zu 40 bis 60 % geringeren Hardwarekosten als proprietäre Plattformen bei vergleichbaren Portgeschwindigkeiten und vergleichbarem Radix.

Ein Anbieter verantwortet die Lösung

Hardware und Software werden in unabhängigen Zyklen erneuert, aber ein Supportvertrag deckt das komplette System ab, sodass ein Team die Lösung verantwortet.

In der Produktion bewährt

Das offene Netzwerk läuft bereits im großen Maßstab

Das Neocloud-Fabric ist keine Laborübung. Es läuft mit demselben OcNOS, das weltweit für Betreiber Produktivverkehr trägt, auf derselben offenen Hardware.

600+
Betreibernetze laufen auf OcNOS bei Service Providern, in Rechenzentren und an Internet-Knoten.
60+
Ländern, in denen OcNOS heute Produktivverkehr trägt.
40+
validierte offene Hardwareplattformen führen OcNOS aus einem Image aus.
FAQ

Neocloud-Networking, beantwortet

Was ist eine Neocloud?
Eine Neocloud ist ein AI-first-Cloud-Anbieter, der auf dichter GPU-Rechenleistung für Training und Inferenz aufbaut, statt auf den Allzweckdiensten eines klassischen Hyperscalers. Neoclouds konkurrieren über reine Beschleunigerleistung, schnelle Skalierung und Kosten, daher ist das Netzwerk, das GPU-Verkehr trägt, ein zentraler Teil der Wirtschaftlichkeit, kein Nachgedanke.
Nutzen Neoclouds InfiniBand oder Ethernet?
Beide werden eingesetzt, und mit dem Hochlauf von 800G bewegt sich die Branche in Richtung Ethernet. Ethernet mit RoCEv2 trägt GPU-Collective-Traffic auf offener Merchant-Silicon-Hardware, sodass eine Neocloud ein verlustfreies AI Fabric ohne Single-Vendor-Stack erhält. OcNOS betreibt das komplette RoCEv2-Toolkit, Priority Flow Control, ECN und adaptives Load Balancing, auf validierter offener Hardware.
Sollte eine Neocloud ein oder zwei Netzwerke für Training und Inferenz bauen?
Training und Inferenz sind gegensätzliche Workloads: Training ist zentralisiert und bandbreitenintensiv, Inferenz ist verteilt, stoßweise und latenzkritisch. Zwei getrennte Netzwerke zu bauen verdoppelt Kapital- und Betriebskosten. Beide auf einem OcNOS-Fabric mit einer Control Plane zu betreiben, lässt eine Neocloud Training und jede Inferenz-Workload aus derselben Infrastruktur bedienen, und genau dort verbessert sich die Betriebsmarge.
Wann braucht eine Neocloud doch zwei getrennte Netzwerke?
Manche Betreiber trennen Training und Inferenz bewusst, und dafür gibt es gute Gründe: strikte Isolation zwischen Mandanten, getrennte Betriebsdomänen für verschiedene Teams, eine harte Leistungsgrenze oder eine bestehende InfiniBand-Insel, die Training bereits trägt. OcNOS läuft in beiden Fällen. Entscheidend ist, dass die Trennung eine bewusste Designentscheidung sein sollte und keine Kostenlast, die die Architektur erzwingt. Wenn ein Team beide Workloads auf einer Control Plane betreiben kann, ist ein Fabric, nach Rolle dimensioniert und lizenziert, die Standardwahl, die die Marge schützt.
Was braucht verteilte Inferenz vom Netzwerk?
Inferenz verteilt sich auf viele regionale und Edge-Standorte, skaliert schnell hoch und runter und hält enge Latenzziele ein, daher braucht das Netzwerk elastische Kapazität, Redundanz auf jeder Ebene und Transport mit niedriger Latenz zwischen den Standorten. IP Infusion deckt den gesamten Pfad ab: das Rechenzentrums-Fabric, den Transport und IP over DWDM zwischen den Standorten sowie IP Maestro für die Assurance.
Wie senkt Open Networking die Kosten einer Neocloud?
Eine Neocloud kauft Switches und Software in unabhängigen Zyklen aus einer Multi-Vendor-Lieferkette und ist so bei Hardware, Software oder Lieferzeiten nicht an einen Anbieter gebunden. OcNOS auf offenen Merchant-Silicon-Switches trägt das AI Fabric zu geringeren Hardwarekosten als proprietäre Plattformen, und ein Anbieter verantwortet weiterhin Software und Support unter einem einzigen Vertrag.
Datenblatt

Nehmen Sie das OcNOS-DC-Datenblatt mit

Ein kurzer, technischer Download, der über diese Seite hinausgeht: das vollständige OcNOS-DC-Datenblatt.

Gestalten Sie Ihr Neocloud-Fabric mit einer Control Plane

Nennen Sie uns die GPU-Größenordnung und die Standorte, die Sie bedienen möchten, und ein IP-Infusion-Techniker hilft Ihnen, ein offenes Fabric für Training und Inferenz zu entwerfen.