Outil de conception d'AI fabric

Concevez de bout en bout un fabric GPU RoCEv2 non bloquant, indépendamment de tout fournisseur. Dimensionnez les commutateurs leaf et spine, planifiez le nombre de transceivers et de câbles, comparez InfiniBand et Ethernet pour votre cluster et obtenez un profil de congestion sans perte. Cet outil conçoit uniquement le réseau. Il ne fournit ni estimation de coût ni nomenclature.

Step 1

Dimensionner la fabric GPU

Choisissez une taille de départ ou saisissez votre propre nombre de GPU, votre débit de port et votre silicium de commutation. L'outil dimensionne un pod leaf-spine à deux niveaux replié et signale lorsqu'un cluster franchit l'échelle à trois niveaux.

SPINE Spine 1Spine 2Spine 3 LEAF Leaf 1Leaf 2Leaf 3Leaf 4 GPU SERVERS
commutateurs leaf
commutateurs spine
nombre total de commutateurs

Ces nombres supposent une leaf-spine (Clos) fabric repliée avec une fabric NIC par GPU, où chaque leaf répartit ses ports entre les GPU et les liaisons montantes vers les spines. Un câblage rail-optimized (plusieurs NIC par GPU) modifie la localité du trafic, mais pas ces nombres de commutateurs. Voir le Conceptions de référence de topologie AI fabric pour les topologies rail-optimized et à trois niveaux.

Step 2

Récapitulatif des composants

Quantités de liaisons fabric, de transceivers et de câbles pour le design dimensionné. Il s'agit uniquement de valeurs de planification, non d'une nomenclature, d'un devis ou d'une tarification.

ComponentBasisQuantity
Liaisons côté GPUGPUs × 1 NIC
Liens de fabric leaf vers spineleaves × uplinks
Transceivers fabriclinks × 2 ends
Câbles de fabric1 par liaison

Le média selon la portée, à choisir en fonction de votre câblage : jusqu'à 3 m en DAC ou AEC, jusqu'à 50 to 100 m en AOC ou SR, jusqu'à 500 m en DR (l'option de référence), jusqu'à 2 km en FR. Classes de portée uniquement. Aucun prix, SKU ni référence fournisseur. Dans une conception à trois niveaux, ajoutez les liens spine vers super-spine en sus des nombres ci-dessus.

Decision

InfiniBand contre Ethernet

Un tableau de bord neutre vis-à-vis des fournisseurs, portant sur six facteurs. Il indique, en fonction de vos paramètres, dans quel sens penche chaque facteur et pourquoi. Il n'y a volontairement pas de vainqueur unique. Utilisez-le comme élément d'entrée d'une revue de conception, et non comme recommandation finale.

FactorInfiniBandEthernet / RoCEv2Ultra Ethernet (trajectory)
Performance de pointeorienté InfiniBandUn avantage de débit brut de l'ordre de 15 pour cent avec un effort de réglage réduit, auquel s'ajoute la réduction in-network SHARP qui décharge les opérations collectives des GPU.Égale InfiniBand avec une optimisation adéquate. Un cluster d'entraînement RoCEv2 de 24 000 GPU a fonctionné en production à performance équivalente. L'écart tient à l'effort d'optimisation, non au plafond.Ajoute le packet spray et le réordonnancement côté NIC pour réduire la latence de queue et diminuer la dépendance au PFC, resserrant ainsi l'écart de sortie de boîte.
Costorienté EthernetImplique un surcoût significatif à l'échelle du fabric, généralement cité dans une fourchette de 30 à 60 pour cent par rapport à un Ethernet comparable.Les commutateurs merchant-silicon et une large chaîne d'approvisionnement en optiques en font généralement la fabric la moins coûteuse par port.La même économie de merchant silicon ouvert que l'Ethernet.
Ouvertureorienté EthernetPile mono-fournisseur de bout en bout (commutateurs, NIC, gestionnaire), si bien que l'approvisionnement multi-fournisseurs est limité.Ouvert et multifournisseur : commutateurs, NIC et NOS basés sur des standards issus de nombreux fournisseurs, préservant la flexibilité de la chaîne d'approvisionnement.Norme de consortium industriel (UEC 1.0, 2025) confortant l'orientation ouverte.
Simplicité opérationnelleneutralUFM fournit un gestionnaire de fabric unique et dédié, clé en main pour les équipes ne disposant pas d'un personnel RDMA aguerri.S'appuie sur le vaste vivier de compétences Ethernet et sur un outillage standard, mais un RoCEv2 sans perte exige un réglage de bout en bout minutieux.Vise à réduire la charge d'optimisation en rapprochant Ethernet d'un comportement prêt à l'emploi comparable à celui d'IB.
Multi-tenancy et convergenceorienté EthernetGénéralement un îlot back-end dédié, sans isolation multi-tenant native ni convergence du stockage.Une fabric Ethernet convergée unique peut acheminer le trafic back-end, de stockage et front-end avec une isolation de locataires standard.Prolonge l'orientation converged-Ethernet sur une seule fabric ouverte.
Trajectoryorienté EthernetMature et stable, offrant des performances de premier plan avec un réglage réduit, mais dépendant de la feuille de route d'un fournisseur unique.Ethernet a basculé pour devenir la technologie de tête des déploiements de back-end IA d'ici mi-2025, portée par une dynamique d'écosystème étendue.UEC 1.0 (2025) est une spécification multifournisseur visant explicitement les back-end fabrics d'IA et de HPC.

Hypothèses : les performances sont comparées après optimisation (l'Ethernet non optimisé reste en retrait, l'Ethernet bien optimisé atteint la parité) ; le coût est exprimé sous forme de fourchette, jamais en valeur monétaire ; l'ouverture désigne un approvisionnement multi-fournisseurs, non un jugement de qualité ; Ultra Ethernet reflète une orientation à partir de 2025, et non un produit disponible. L'optimisation collective renvoie de manière générique aux bibliothèques xCCL. Ces éléments éclairent la décision ; validez tout choix de fabric avec un ingénieur IP Infusion.

Profil

Profil sans perte RoCEv2

RoCEv2 n'est pas une simple fonctionnalité de commutateur. Il s'agit d'un profil composé de PFC, ECN et ETS, DCQCN assurant le travail en régime permanent et PFC servant de garde-fou. Cet outil recommande les mécanismes ainsi que l'ordre dans lequel les appliquer pour votre conception. Il n'émet aucune valeur de seuil et n'intervient sur aucun équipement.

MechanismRôle dans le profil sans perteDisponibilité d'OcNOS
PFCGarantie sans perte de paquets pour la classe RoCE. Un garde-fou de dernier recours, non le mécanisme de contrôle principal.Les 4 plateformes AI
ECNMarque la congestion tôt afin que les émetteurs réduisent leur débit avant le débordement des files. Réglez son point de marquage en dessous du déclencheur PFC.Les 4 plateformes AI
DCQCN (ECN + PFC)Contrôle principal en régime établi. Le marquage ECN pilote la réaction DCQCN au niveau des NIC ; le PFC vient en renfort. Un mécanisme composé, non une fonctionnalité autonome.Les 4 plateformes AI
ETSDes garanties de bande passante et une isolation de classe afin que la classe sans perte ne soit pas privée de ressources par le trafic best-effort.Les 4 plateformes AI
Watchdog anti-interblocage PFCDétecte et rompt les situations d'interblocage ou de tempête de pause PFC : le filet de sécurité du dispositif de secours PFC.Les 4, OcNOS 7.0
DLB (équilibrage de charge dynamique)Répartit les flux RoCE éléphants qui entrent en collision avec un ECMP statique. Fait passer l'utilisation de la fabric d'environ 55 pour cent à 90 pour cent et au-delà.Les 4 plateformes AI
ECN dynamiqueAdapte le marquage ECN aux conditions de file d'attente en temps réel, réduisant le réajustement manuel à mesure que la charge évolue.TH5 uniquement, OcNOS 7.0
DLB réactif / aléatoireModes de placement DLB avancés pour une répartition de flux plus serrée. Sur TH4, utilisez le DLB standard.TH5 uniquement, OcNOS 7.0
GLB (Global Load Balancing)Répartition de charge à l'échelle de la fabric, au-delà des décisions DLB locales.Feuille de route, train OcNOS 7.1
Ultra EthernetPacket spray avec réordonnancement côté NIC et dépendance réduite au PFC, la trajectoire vers l'Ethernet AI lossless.Feuille de route, profil UEC

À titre indicatif uniquement. Ces recommandations ne sont poussées vers aucun équipement et aucune valeur de seuil n'est générée ici. La disponibilité est conforme à l'OcNOS-DC. Matrice de fonctionnalités and Liste de compatibilité matérielle. Validez par rapport aux plateformes sélectionnées et à la version d'OcNOS avant le déploiement.

Estimate

Consommation de la fabric

Une plage de puissance typique pour les commutateurs de la fabric dans la conception dimensionnée. Plages uniquement, optiques incluses. Les commutateurs réseau ne représentent qu'une faible part de la puissance totale du cluster ; ce sont les GPU qui prédominent.

kW valeur basse typique
kW en pleine charge

Refroidissement : le refroidissement par porte arrière ou par liquide direct est généralement envisagé au-delà d'environ 30 à 40 kW par baie, en raison de la densité des serveurs GPU et non du réseau. Il s'agit d'une orientation, non d'une charge thermique calculée. Les plages de puissance des commutateurs sont des valeurs typiques pour des châssis de classe 51,2T (Tomahawk 5) et 25,6T (Tomahawk 4) équipés d'optiques ; confirmez les chiffres exacts sur la fiche technique de chaque plateforme.

Plateformes OcNOS-DC correspondantes

La fabric exécute une image OcNOS-DC unique sur du matériel ouvert Broadcom Tomahawk. Voici les plateformes 800G et 400G prises en charge sur lesquelles elle se conçoit.

Cet outil fournit une estimation structurelle de conception réseau à des fins de planification uniquement. Il ne constitue ni une garantie de performance, ni une nomenclature, ni une estimation de coût. Les conceptions réelles dépendent de l'optimisation des rails, du nombre de NIC par GPU, du câblage et des choix de domaine de défaillance. Les nombres de GPU sont des plafonds de conception de référence issus du calcul de radix Clos, et non des valeurs mesurées. Broadcom et Tomahawk sont des marques de Broadcom Inc. ; les autres noms sont les marques de leurs détenteurs respectifs.

Ressource

Conception de référence pour l'AI fabric

Obtenez le PDF de conception de référence : topologie, nombre de switchs, récapitulatif des composants et un profil de départ RoCEv2 sans perte.

Télécharger le PDF
FAQ

Questions fréquentes

Comment dimensionner une leaf-spine fabric pour un cluster de GPU ?
Dans une fabric leaf-spine non bloquante à deux niveaux, chaque commutateur leaf consacre la moitié de ses ports aux GPU et l'autre moitié aux liaisons montantes vers les spines. Le nombre de commutateurs leaf correspond au nombre de GPU divisé par le nombre de ports orientés GPU par leaf, et le nombre de commutateurs spine est le minimum requis pour transporter chaque liaison montante des leaf sans surabonnement. Un cluster à leaf unique n'a pas besoin de niveau spine. Cet outil calcule ces nombres pour les Broadcom Tomahawk 4 et Tomahawk 5 en 400G ou 800G.
Qu'est-ce qu'une topologie rail-optimized ?
Rail-optimized signifie que chaque serveur GPU dispose de plusieurs NIC (généralement 8, un par rail) et que chaque rail se raccorde à son propre leaf ; ainsi, les GPU de même index sur les différents serveurs aboutissent au même leaf et le trafic AllReduce dominant reste local. Il s'agit d'une discipline de câblage et de localité du trafic superposée à une fabric 1:1 non bloquante. Elle modifie le cheminement du trafic, non le nombre de commutateurs leaf et spine.
Combien de transceivers une AI fabric nécessite-t-elle ?
Chaque liaison fabric point à point utilise deux transceivers, un à chaque extrémité, de sorte que le nombre de transceivers correspond au nombre de liaisons leaf-to-spine multiplié par deux. Le nombre de liaisons est égal au nombre de leaves multiplié par leurs uplinks, ce qui équivaut également au nombre de spines multiplié par leurs downlinks. Cet outil indique ces quantités. Il s'agit uniquement de valeurs de planification, non d'une nomenclature ni d'un devis.
RoCEv2 ou InfiniBand : lequel convient le mieux à l'IA ?
Aucun des deux n'est universellement supérieur. InfiniBand se distingue par des performances brutes élevées avec peu d'effort d'optimisation et propose un gestionnaire de fabric unique. Ethernet avec RoCEv2 atteint ces performances une fois optimisé et l'emporte généralement sur le coût, l'ouverture, la multitenance et la trajectoire du secteur. Le fabric approprié dépend de la taille du cluster, des effectifs et de la pile existante. Cet outil pondère les facteurs selon vos paramètres, puis confie la décision à une revue de conception.
Comment rendre une AI fabric sans perte pour RoCEv2 ?
Le RoCEv2 lossless repose sur trois mécanismes agissant de concert : PFC pour une classe sans perte, ECN pour la signalisation précoce de la congestion et ETS pour l'isolation des classes. Le DCQCN, qui associe ECN et PFC, constitue le contrôle principal en régime établi, tandis que le PFC sert de filet de sécurité de dernier recours ; il convient donc de régler le seuil de marquage ECN en dessous du seuil PFC. Maintenez PFC, ECN et CoS cohérents de bout en bout. OcNOS-DC prend en charge ces mécanismes sur les plateformes Tomahawk AI.
La même image OcNOS s'exécute-t-elle sur chaque commutateur de la fabric ?
Oui. Chaque commutateur leaf et spine exécute une image OcNOS-DC unique intégrant RoCEv2, PFC et ECN ainsi que l'équilibrage de charge dynamique, sur du matériel Tomahawk ouvert. La fabric repose ainsi sur un seul système d'exploitation et un seul contrat de support, quel que soit le nombre de commutateurs qu'engendre la conception.