Networking-Definition · Scale-out · RoCEv2

Was ist eine GPU-Fabric?

Eine GPU-Fabric ist das Back-End-Netzwerk, das GPUs über Server und Pods hinweg verbindet, sodass sie gemeinsam an einem Trainings- oder Inferenz-Job arbeiten können. Sie transportiert den RDMA-Traffic, den GPUs während kollektiver Operationen austauschen, getrennt vom Front-End-Netzwerk für Management und Storage. Sie ist das Scale-out-Netzwerk, das dort beginnt, wo die serverinterne Scale-up-Domäne wie NVLink endet, aufgebaut aus rail-optimierten und Clos-Topologien mit verlustfreiem RoCEv2, und OcNOS-DC stellt sie auf Broadcom Tomahawk 5-Hardware bereit.

~2,048 GPUsZweistufig, 1:1 blockierungsfrei
16,000+ GPUs3-stufige Clos-Skalierung
51,2 TbpsTomahawk 5 · 64x800G
1 NOSOcNOS-DC auf offener Hardware
Wo die Fabric beginnt

Scale-up endet, Scale-out beginnt

Eine GPU-Fabric liegt auf einer Seite einer klaren Grenze. Innerhalb eines Servers läuft die Scale-up-Domäne mit Terabit-Geschwindigkeiten; zwischen Servern transportiert die Scale-out-GPU-Fabric den Rest. Ein Kollektiv nutzt zuerst Scale-up innerhalb der Domäne, dann transportiert diese Fabric den serverübergreifenden Traffic.

Innerhalb des Servers

Scale-up-Domäne

Der Interconnect mit sehr hoher Bandbreite innerhalb eines GPU-Servers und seiner eng gekoppelten Domäne, zum Beispiel NVLink innerhalb eines NVL72-Racks. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.

Zwischen Servern

Scale-out-GPU-Fabric

Das Ethernet-Netzwerk zwischen Servern und Pods über Rail-, Leaf-, Spine- und Clos-Ebenen hinweg. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.

Wie die Fabric geformt ist

Rails und Clos

Die meisten GPU-Fabrics sind rail-optimierte Leaf-Spine-Netzwerke: Jede der 8 NICs eines GPU-Servers verbindet sich mit ihrem eigenen dedizierten Rail-Leaf, sodass der dominante Same-Rail-AllReduce-Traffic auf einem Leaf bleibt und niemals den Spine überquert. Über einen einzelnen Pod hinaus erweitert sich das Design zu einem 3-stufigen Clos mit einer Super-Spine-Ebene.

Rail-optimierte Leaves

Jede der 8 NICs eines Servers wird ihrem eigenen Rail-Leaf zugeordnet, wodurch der dominante Same-Rail-AllReduce-Traffic auf einem Leaf und vom Spine ferngehalten wird.

3-stufige Clos-Skalierung

Auf Radix-64-Tomahawk 5 erreicht eine 2-stufige Fabric etwa 2,048 GPUs bei 1:1 blockierungsfrei; ein 3-stufiges Clos skaliert auf 16,000+ GPUs.

Verlustfreier RoCEv2-Transport

Die GPU-Ebene transportiert RDMA über RoCEv2, verlustfrei ausgelegt, sodass ein Kollektiv niemals an einem verworfenen Paket ins Stocken gerät.

Auf der GPU-Ebene

Verlustfreies RoCEv2, und OcNOS-DC liefert es

GPUs bewegen Daten mit RDMA über RoCEv2, das bei Paketverlust schlecht funktioniert. Daher ist die GPU-Fabric verlustfrei ausgelegt und wird gleichmäßig ausgelastet gehalten, sodass kein Link während eines Kollektivs zum Hotspot wird. OcNOS-DC stellt genau dies auf Broadcom Tomahawk 5 bereit, als Enabler für offene Multi-Vendor-Hardware.

  • Verlustfrei ausgelegt mit Priority Flow Control (auch über L3) und ECN, sodass ein Trainingsschritt niemals an einem verworfenen Paket ins Stocken gerät.
  • Gleichmäßig ausgelastet gehalten mit Dynamic ECN und DLB, sodass kein einzelner Link während eines Kollektivs zum Hotspot wird.
  • Geliefert von OcNOS-DC auf Broadcom Tomahawk 5-Plattformen (51.2 Tbps, 64x800G) wie dem Edgecore AIS800-64D und UfiSpace S9321-64E.
FAQ

FAQ: Was ist eine GPU-Fabric

Was ist ein GPU-Fabric?
Eine GPU-Fabric ist das Back-End-Netzwerk, das GPUs über Server und Pods hinweg verbindet, sodass sie gemeinsam an einem einzelnen Trainings- oder Inferenz-Job arbeiten können. Sie transportiert den RDMA-Traffic, den GPUs während kollektiver Operationen austauschen, und ist vom Front-End-Netzwerk für Management und Storage getrennt. In der Praxis ist eine GPU-Fabric ein Leaf-Spine-Ethernet-Netzwerk (Clos), üblicherweise rail-optimiert, mit verlustfreiem RoCEv2. OcNOS-DC stellt sie auf Broadcom Tomahawk 5-Hardware bereit.
Was ist der Unterschied zwischen Scale-up und Scale-out?
Scale-up ist der Interconnect mit sehr hoher Bandbreite innerhalb eines GPU-Servers und seiner eng gekoppelten Domäne, zum Beispiel NVLink innerhalb eines NVL72-Racks, wo GPUs mit Terabit-Geschwindigkeiten kommunizieren, als wären sie ein einziger großer Beschleuniger. Scale-out ist das Netzwerk zwischen Servern und Pods, die GPU-Fabric, die diese Seite beschreibt, aufgebaut aus Rail-, Leaf-, Spine- und Clos-Ebenen über Ethernet. Ein Kollektiv nutzt zuerst Scale-up innerhalb der Domäne, dann transportiert die Scale-out-GPU-Fabric den Rest zwischen Servern.
Welche Topologie verwendet eine GPU-Fabric?
Most GPU fabrics use a rail-optimized leaf-spine design: each of a GPU server's 8 NICs connects to its own dedicated rail leaf, so the dominant same-rail AllReduce traffic stays on one leaf. As the cluster grows past a single pod, the design extends to a 3-stage Clos with a super-spine tier. Auf Radix-64-Tomahawk 5 erreicht eine 2-stufige Fabric etwa 2,048 GPUs at 1:1 non-blocking and a 3-stage Clos scales to 16,000+ GPUs. See the rail-optimized network and AI fabric topologies pages.
Muss eine GPU-Fabric verlustfrei sein?
Ja, auf der GPU-Ebene. GPUs bewegen Daten mit RDMA über RoCEv2, das bei Paketverlust schlecht funktioniert, daher ist die GPU-Fabric verlustfrei mit Priority Flow Control und ECN ausgelegt und wird mit dynamischem Load-Balancing gleichmäßig ausgelastet gehalten. Dieses No-Drop-Verhalten verhindert, dass ein Kollektiv ins Stocken gerät. OcNOS-DC stellt PFC, ECN, Dynamic ECN und DLB auf Broadcom Tomahawk 5 für genau dies bereit.

Bauen Sie eine GPU-Fabric auf? Dimensionieren wir die Ebene gemeinsam.

Nennen Sie uns die GPU-Anzahl und den Workload, und ein IP Infusion-Ingenieur führt die Port-Berechnung gemeinsam mit Ihnen durch, oder beginnen Sie mit einem ersten rail-optimierten Entwurf in der AI Fabric Design Suite.