Was ist eine GPU-Fabric?
Eine GPU-Fabric ist das Back-End-Netzwerk, das GPUs über Server und Pods hinweg verbindet, sodass sie gemeinsam an einem Trainings- oder Inferenz-Job arbeiten können. Sie transportiert den RDMA-Traffic, den GPUs während kollektiver Operationen austauschen, getrennt vom Front-End-Netzwerk für Management und Storage. Sie ist das Scale-out-Netzwerk, das dort beginnt, wo die serverinterne Scale-up-Domäne wie NVLink endet, aufgebaut aus rail-optimierten und Clos-Topologien mit verlustfreiem RoCEv2, und OcNOS-DC stellt sie auf Broadcom Tomahawk 5-Hardware bereit.
Scale-up endet, Scale-out beginnt
Eine GPU-Fabric liegt auf einer Seite einer klaren Grenze. Innerhalb eines Servers läuft die Scale-up-Domäne mit Terabit-Geschwindigkeiten; zwischen Servern transportiert die Scale-out-GPU-Fabric den Rest. Ein Kollektiv nutzt zuerst Scale-up innerhalb der Domäne, dann transportiert diese Fabric den serverübergreifenden Traffic.
Scale-up-Domäne
Der Interconnect mit sehr hoher Bandbreite innerhalb eines GPU-Servers und seiner eng gekoppelten Domäne, zum Beispiel NVLink innerhalb eines NVL72-Racks. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.
Scale-out-GPU-Fabric
Das Ethernet-Netzwerk zwischen Servern und Pods über Rail-, Leaf-, Spine- und Clos-Ebenen hinweg. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.
Rails und Clos
Die meisten GPU-Fabrics sind rail-optimierte Leaf-Spine-Netzwerke: Jede der 8 NICs eines GPU-Servers verbindet sich mit ihrem eigenen dedizierten Rail-Leaf, sodass der dominante Same-Rail-AllReduce-Traffic auf einem Leaf bleibt und niemals den Spine überquert. Über einen einzelnen Pod hinaus erweitert sich das Design zu einem 3-stufigen Clos mit einer Super-Spine-Ebene.
Rail-optimierte Leaves
Jede der 8 NICs eines Servers wird ihrem eigenen Rail-Leaf zugeordnet, wodurch der dominante Same-Rail-AllReduce-Traffic auf einem Leaf und vom Spine ferngehalten wird.
3-stufige Clos-Skalierung
Auf Radix-64-Tomahawk 5 erreicht eine 2-stufige Fabric etwa 2,048 GPUs bei 1:1 blockierungsfrei; ein 3-stufiges Clos skaliert auf 16,000+ GPUs.
Verlustfreier RoCEv2-Transport
Die GPU-Ebene transportiert RDMA über RoCEv2, verlustfrei ausgelegt, sodass ein Kollektiv niemals an einem verworfenen Paket ins Stocken gerät.
Verlustfreies RoCEv2, und OcNOS-DC liefert es
GPUs bewegen Daten mit RDMA über RoCEv2, das bei Paketverlust schlecht funktioniert. Daher ist die GPU-Fabric verlustfrei ausgelegt und wird gleichmäßig ausgelastet gehalten, sodass kein Link während eines Kollektivs zum Hotspot wird. OcNOS-DC stellt genau dies auf Broadcom Tomahawk 5 bereit, als Enabler für offene Multi-Vendor-Hardware.
- Verlustfrei ausgelegt mit Priority Flow Control (auch über L3) und ECN, sodass ein Trainingsschritt niemals an einem verworfenen Paket ins Stocken gerät.
- Gleichmäßig ausgelastet gehalten mit Dynamic ECN und DLB, sodass kein einzelner Link während eines Kollektivs zum Hotspot wird.
- Geliefert von OcNOS-DC auf Broadcom Tomahawk 5-Plattformen (51.2 Tbps, 64x800G) wie dem Edgecore AIS800-64D und UfiSpace S9321-64E.
FAQ: Was ist eine GPU-Fabric
Was ist ein GPU-Fabric?
Was ist der Unterschied zwischen Scale-up und Scale-out?
Welche Topologie verwendet eine GPU-Fabric?
Muss eine GPU-Fabric verlustfrei sein?
Gehen Sie tiefer. Nehmen Sie es mit.
Zwei kurze, technische Downloads, die weiter gehen als diese Seite: das vollständige OcNOS-DC-Datenblatt und die verlustfreie 800G-KI-Fabric-Architektur.
OcNOS-DC Datenblatt
Vollständige OcNOS-DC Spezifikation: Funktionsumfang für EVPN-VXLAN und Ethernet for AI, Software-SKUs, unterstützte Hardware-Plattformen und der Solution Ordering Guide.
Datasheet abrufenOcNOS 800G verlustfreie AI Fabric
Non-blocking RoCEv2-Fabric auf Broadcom Tomahawk 4/5 Spines: SKU-Stufen, validierte Plattformen und Deployment-Architektur.
Brief anfordernOcNOS-DC Datenblatt
Kurzes Formular. Ihr PDF öffnet sich unmittelbar nach dem Absenden in einem neuen Tab.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
OcNOS 800G verlustfreie AI Fabric
Kurzes Formular. Ihr PDF öffnet sich unmittelbar nach dem Absenden in einem neuen Tab.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
Bauen Sie eine GPU-Fabric auf? Dimensionieren wir die Ebene gemeinsam.
Nennen Sie uns die GPU-Anzahl und den Workload, und ein IP Infusion-Ingenieur führt die Port-Berechnung gemeinsam mit Ihnen durch, oder beginnen Sie mit einem ersten rail-optimierten Entwurf in der AI Fabric Design Suite.
Die gesamte KI-Fabric mit OcNOS entwerfen
Vom Business Case bis zur Portanzahl-Berechnung: Steigen Sie dort ein, wo Sie beim Aufbau gerade stehen.