Définition réseau · Scale-out · RoCEv2

Qu'est-ce qu'un fabric GPU ?

Un fabric GPU est le réseau back-end qui interconnecte les GPU à travers les serveurs et les pods afin qu'ils puissent travailler ensemble sur une même tâche d'entraînement ou d'inférence. Il transporte le trafic RDMA que les GPU échangent pendant les opérations collectives, distinct du réseau front-end utilisé pour la gestion et le stockage. C'est le réseau scale-out qui commence là où s'arrête le domaine scale-up intra-serveur, tel que NVLink, construit à partir de topologies rail-optimized et Clos exécutant du RoCEv2 sans perte, et OcNOS-DC le fournit sur du matériel Broadcom Tomahawk 5.

~2,048 GPUs2 niveaux, 1:1 non bloquant
16,000+ GPUÉchelle Clos à 3 étages
51,2 TbpsTomahawk 5 · 64x800G
1 NOSOcNOS-DC sur matériel ouvert
Où commence le fabric

Le scale-up s'arrête, le scale-out commence

Un fabric GPU se situe d'un côté d'une frontière nette. À l'intérieur d'un serveur, le domaine scale-up fonctionne à des débits en térabits ; entre les serveurs, le fabric GPU scale-out transporte le reste. Un collectif utilise d'abord le scale-up à l'intérieur du domaine, puis ce fabric transporte le trafic inter-serveurs.

À l'intérieur du serveur

Domaine scale-up

L'interconnexion à très haut débit à l'intérieur d'un serveur GPU et de son domaine étroitement couplé, par exemple NVLink au sein d'un rack NVL72. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.

Entre les serveurs

Fabric GPU scale-out

Le réseau Ethernet entre les serveurs et les pods à travers les niveaux rail, leaf, spine et Clos. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.

Comment le fabric est structuré

Rails et Clos

La plupart des fabrics GPU sont des réseaux leaf-spine rail-optimized : chacune des 8 NIC d'un serveur GPU se connecte à son propre rail leaf dédié, de sorte que le trafic AllReduce dominant sur un même rail reste sur un seul leaf et ne traverse jamais le spine. Au-delà d'un seul pod, la conception s'étend à un Clos à 3 étages avec un niveau super-spine.

Leaves rail-optimized

Chacune des 8 NICs NIC d'un serveur correspond à son propre rail leaf, en gardant le trafic AllReduce dominant sur un même rail sur un seul leaf et hors du spine.

Échelle Clos à 3 étages

Sur un Tomahawk 5 radix-64, un fabric à 2 niveaux atteint environ 2,048 GPUs en non bloquant 1:1 ; un Clos à 3 étages passe à l'échelle jusqu'à 16,000+ GPU.

Transport RoCEv2 sans perte

Le plan GPU transporte le RDMA sur RoCEv2, conçu sans perte pour qu'un collectif ne se bloque jamais sur un paquet perdu.

Sur le plan GPU

RoCEv2 sans perte, et OcNOS-DC le fournit

Les GPU déplacent les données avec RDMA sur RoCEv2, qui fonctionne mal en cas de perte de paquets. Le fabric GPU est donc conçu sans perte et maintenu uniformément chargé, afin qu'aucun lien ne devienne un point chaud pendant un collectif. OcNOS-DC fournit exactement cela sur Broadcom Tomahawk 5, comme catalyseur de matériel ouvert et multi-fournisseurs.

  • Conçu sans perte avec le Priority Flow Control (y compris over L3) et l'ECN, pour qu'une étape d'entraînement ne se bloque jamais sur un paquet perdu.
  • Maintenu uniformément chargé avec Dynamic ECN et DLB, afin qu'aucun lien ne devienne un point chaud pendant un collectif.
  • Fourni par OcNOS-DC sur des plateformes Broadcom Tomahawk 5 (51.2 Tbps, 64x800G) comme l'Edgecore AIS800-64D et l'UfiSpace S9321-64E.
FAQ

FAQ : Qu'est-ce qu'un fabric GPU

Qu'est-ce qu'un GPU fabric ?
Un fabric GPU est le réseau back-end qui interconnecte les GPU à travers les serveurs et les pods afin qu'ils puissent travailler ensemble sur une seule tâche d'entraînement ou d'inférence. Il transporte le trafic RDMA que les GPU échangent pendant les opérations collectives, et il est distinct du réseau front-end utilisé pour la gestion et le stockage. En pratique, un fabric GPU est un réseau Ethernet leaf-spine (Clos), généralement rail-optimized, exécutant du RoCEv2 sans perte. OcNOS-DC le fournit sur du matériel Broadcom Tomahawk 5.
Quelle est la différence entre le scale-up et le scale-out ?
Le scale-up est l'interconnexion à très haut débit à l'intérieur d'un serveur GPU et de son domaine étroitement couplé, par exemple NVLink au sein d'un rack NVL72, où les GPU communiquent à des débits en térabits comme s'ils formaient un seul grand accélérateur. Le scale-out est le réseau entre les serveurs et les pods, le fabric GPU décrit sur cette page, construit à partir des niveaux rail, leaf, spine et Clos sur Ethernet. Un collectif utilise d'abord le scale-up à l'intérieur du domaine, puis le fabric GPU scale-out transporte le reste entre les serveurs.
Quelle topologie un fabric GPU utilise-t-il ?
Most GPU fabrics use a rail-optimized leaf-spine design: each of a GPU server's 8 NICs connects to its own dedicated rail leaf, so the dominant same-rail AllReduce traffic stays on one leaf. As the cluster grows past a single pod, the design extends to a 3-stage Clos with a super-spine tier. Sur un Tomahawk 5 radix-64, un fabric à 2 niveaux atteint environ 2,048 GPUs at 1:1 non-blocking and a 3-stage Clos scales to 16,000+ GPUs. See the rail-optimized network and AI fabric topologies pages.
Un fabric GPU doit-il être sans perte ?
Oui, sur le plan GPU. Les GPU déplacent les données avec RDMA sur RoCEv2, qui fonctionne mal en cas de perte de paquets ; le fabric GPU est donc conçu sans perte avec le Priority Flow Control et l'ECN, et maintenu uniformément chargé grâce à l'équilibrage de charge dynamique. Ce comportement sans perte est ce qui empêche un collectif de se bloquer. OcNOS-DC fournit PFC, ECN, Dynamic ECN et DLB sur Broadcom Tomahawk 5 précisément pour cela.

Vous mettez en place un fabric GPU ? Dimensionnons le plan ensemble.

Indiquez-nous le nombre de GPU et la charge de travail, et un ingénieur IP Infusion réalisera avec vous les calculs de ports, ou partez d'une première ébauche d'implantation rail-optimized dans l'AI Fabric Design Suite.