Qu'est-ce qu'un fabric GPU ?
Un fabric GPU est le réseau back-end qui interconnecte les GPU à travers les serveurs et les pods afin qu'ils puissent travailler ensemble sur une même tâche d'entraînement ou d'inférence. Il transporte le trafic RDMA que les GPU échangent pendant les opérations collectives, distinct du réseau front-end utilisé pour la gestion et le stockage. C'est le réseau scale-out qui commence là où s'arrête le domaine scale-up intra-serveur, tel que NVLink, construit à partir de topologies rail-optimized et Clos exécutant du RoCEv2 sans perte, et OcNOS-DC le fournit sur du matériel Broadcom Tomahawk 5.
Le scale-up s'arrête, le scale-out commence
Un fabric GPU se situe d'un côté d'une frontière nette. À l'intérieur d'un serveur, le domaine scale-up fonctionne à des débits en térabits ; entre les serveurs, le fabric GPU scale-out transporte le reste. Un collectif utilise d'abord le scale-up à l'intérieur du domaine, puis ce fabric transporte le trafic inter-serveurs.
Domaine scale-up
L'interconnexion à très haut débit à l'intérieur d'un serveur GPU et de son domaine étroitement couplé, par exemple NVLink au sein d'un rack NVL72. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.
Fabric GPU scale-out
Le réseau Ethernet entre les serveurs et les pods à travers les niveaux rail, leaf, spine et Clos. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.
Rails et Clos
La plupart des fabrics GPU sont des réseaux leaf-spine rail-optimized : chacune des 8 NIC d'un serveur GPU se connecte à son propre rail leaf dédié, de sorte que le trafic AllReduce dominant sur un même rail reste sur un seul leaf et ne traverse jamais le spine. Au-delà d'un seul pod, la conception s'étend à un Clos à 3 étages avec un niveau super-spine.
Leaves rail-optimized
Chacune des 8 NICs NIC d'un serveur correspond à son propre rail leaf, en gardant le trafic AllReduce dominant sur un même rail sur un seul leaf et hors du spine.
Échelle Clos à 3 étages
Sur un Tomahawk 5 radix-64, un fabric à 2 niveaux atteint environ 2,048 GPUs en non bloquant 1:1 ; un Clos à 3 étages passe à l'échelle jusqu'à 16,000+ GPU.
Transport RoCEv2 sans perte
Le plan GPU transporte le RDMA sur RoCEv2, conçu sans perte pour qu'un collectif ne se bloque jamais sur un paquet perdu.
RoCEv2 sans perte, et OcNOS-DC le fournit
Les GPU déplacent les données avec RDMA sur RoCEv2, qui fonctionne mal en cas de perte de paquets. Le fabric GPU est donc conçu sans perte et maintenu uniformément chargé, afin qu'aucun lien ne devienne un point chaud pendant un collectif. OcNOS-DC fournit exactement cela sur Broadcom Tomahawk 5, comme catalyseur de matériel ouvert et multi-fournisseurs.
- Conçu sans perte avec le Priority Flow Control (y compris over L3) et l'ECN, pour qu'une étape d'entraînement ne se bloque jamais sur un paquet perdu.
- Maintenu uniformément chargé avec Dynamic ECN et DLB, afin qu'aucun lien ne devienne un point chaud pendant un collectif.
- Fourni par OcNOS-DC sur des plateformes Broadcom Tomahawk 5 (51.2 Tbps, 64x800G) comme l'Edgecore AIS800-64D et l'UfiSpace S9321-64E.
FAQ : Qu'est-ce qu'un fabric GPU
Qu'est-ce qu'un GPU fabric ?
Quelle est la différence entre le scale-up et le scale-out ?
Quelle topologie un fabric GPU utilise-t-il ?
Un fabric GPU doit-il être sans perte ?
Approfondissez. Emportez-le avec vous.
Deux téléchargements techniques et concis qui vont plus loin que cette page : la fiche technique complète OcNOS-DC et l'architecture de fabric IA 800G sans perte.
Datasheet OcNOS-DC
Spécification complète OcNOS-DC : l'ensemble des fonctionnalités EVPN-VXLAN et Ethernet for AI, les SKU logiciels, les plateformes matérielles prises en charge et le guide de commande de la solution.
Obtenir la fiche techniqueOcNOS 800G Fabric IA sans perte
Fabric RoCEv2 non bloquante sur des spines Broadcom Tomahawk 4/5 : niveaux de SKU, plateformes validées et architecture de déploiement.
Obtenir le briefDatasheet OcNOS-DC
Formulaire rapide. Votre PDF s'ouvre dans un nouvel onglet immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
OcNOS 800G Fabric IA sans perte
Formulaire rapide. Votre PDF s'ouvre dans un nouvel onglet immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
Vous mettez en place un fabric GPU ? Dimensionnons le plan ensemble.
Indiquez-nous le nombre de GPU et la charge de travail, et un ingénieur IP Infusion réalisera avec vous les calculs de ports, ou partez d'une première ébauche d'implantation rail-optimized dans l'AI Fabric Design Suite.
Concevez tout le fabric IA avec OcNOS
Du dossier économique au calcul du nombre de ports, reprenez où vous en êtes dans la construction.