Outil de conception d'AI fabric
Concevez de bout en bout un fabric GPU RoCEv2 non bloquant, indépendamment de tout fournisseur. Dimensionnez les commutateurs leaf et spine, planifiez le nombre de transceivers et de câbles, comparez InfiniBand et Ethernet pour votre cluster et obtenez un profil de congestion sans perte. Cet outil conçoit uniquement le réseau. Il ne fournit ni estimation de coût ni nomenclature.
Dimensionner la fabric GPU
Choisissez une taille de départ ou saisissez votre propre nombre de GPU, votre débit de port et votre silicium de commutation. L'outil dimensionne un pod leaf-spine à deux niveaux replié et signale lorsqu'un cluster franchit l'échelle à trois niveaux.
…
Ces nombres supposent une leaf-spine (Clos) fabric repliée avec une fabric NIC par GPU, où chaque leaf répartit ses ports entre les GPU et les liaisons montantes vers les spines. Un câblage rail-optimized (plusieurs NIC par GPU) modifie la localité du trafic, mais pas ces nombres de commutateurs. Voir le Conceptions de référence de topologie AI fabric pour les topologies rail-optimized et à trois niveaux.
Récapitulatif des composants
Quantités de liaisons fabric, de transceivers et de câbles pour le design dimensionné. Il s'agit uniquement de valeurs de planification, non d'une nomenclature, d'un devis ou d'une tarification.
| Component | Basis | Quantity |
|---|---|---|
| Liaisons côté GPU | GPUs × 1 NIC | … |
| Liens de fabric leaf vers spine | leaves × uplinks | … |
| Transceivers fabric | links × 2 ends | … |
| Câbles de fabric | 1 par liaison | … |
Le média selon la portée, à choisir en fonction de votre câblage : jusqu'à 3 m en DAC ou AEC, jusqu'à 50 to 100 m en AOC ou SR, jusqu'à 500 m en DR (l'option de référence), jusqu'à 2 km en FR. Classes de portée uniquement. Aucun prix, SKU ni référence fournisseur. Dans une conception à trois niveaux, ajoutez les liens spine vers super-spine en sus des nombres ci-dessus.
InfiniBand contre Ethernet
Un tableau de bord neutre vis-à-vis des fournisseurs, portant sur six facteurs. Il indique, en fonction de vos paramètres, dans quel sens penche chaque facteur et pourquoi. Il n'y a volontairement pas de vainqueur unique. Utilisez-le comme élément d'entrée d'une revue de conception, et non comme recommandation finale.
| Factor | InfiniBand | Ethernet / RoCEv2 | Ultra Ethernet (trajectory) |
|---|---|---|---|
| Performance de pointeorienté InfiniBand | Un avantage de débit brut de l'ordre de 15 pour cent avec un effort de réglage réduit, auquel s'ajoute la réduction in-network SHARP qui décharge les opérations collectives des GPU. | Égale InfiniBand avec une optimisation adéquate. Un cluster d'entraînement RoCEv2 de 24 000 GPU a fonctionné en production à performance équivalente. L'écart tient à l'effort d'optimisation, non au plafond. | Ajoute le packet spray et le réordonnancement côté NIC pour réduire la latence de queue et diminuer la dépendance au PFC, resserrant ainsi l'écart de sortie de boîte. |
| Costorienté Ethernet | Implique un surcoût significatif à l'échelle du fabric, généralement cité dans une fourchette de 30 à 60 pour cent par rapport à un Ethernet comparable. | Les commutateurs merchant-silicon et une large chaîne d'approvisionnement en optiques en font généralement la fabric la moins coûteuse par port. | La même économie de merchant silicon ouvert que l'Ethernet. |
| Ouvertureorienté Ethernet | Pile mono-fournisseur de bout en bout (commutateurs, NIC, gestionnaire), si bien que l'approvisionnement multi-fournisseurs est limité. | Ouvert et multifournisseur : commutateurs, NIC et NOS basés sur des standards issus de nombreux fournisseurs, préservant la flexibilité de la chaîne d'approvisionnement. | Norme de consortium industriel (UEC 1.0, 2025) confortant l'orientation ouverte. |
| Simplicité opérationnelleneutral | UFM fournit un gestionnaire de fabric unique et dédié, clé en main pour les équipes ne disposant pas d'un personnel RDMA aguerri. | S'appuie sur le vaste vivier de compétences Ethernet et sur un outillage standard, mais un RoCEv2 sans perte exige un réglage de bout en bout minutieux. | Vise à réduire la charge d'optimisation en rapprochant Ethernet d'un comportement prêt à l'emploi comparable à celui d'IB. |
| Multi-tenancy et convergenceorienté Ethernet | Généralement un îlot back-end dédié, sans isolation multi-tenant native ni convergence du stockage. | Une fabric Ethernet convergée unique peut acheminer le trafic back-end, de stockage et front-end avec une isolation de locataires standard. | Prolonge l'orientation converged-Ethernet sur une seule fabric ouverte. |
| Trajectoryorienté Ethernet | Mature et stable, offrant des performances de premier plan avec un réglage réduit, mais dépendant de la feuille de route d'un fournisseur unique. | Ethernet a basculé pour devenir la technologie de tête des déploiements de back-end IA d'ici mi-2025, portée par une dynamique d'écosystème étendue. | UEC 1.0 (2025) est une spécification multifournisseur visant explicitement les back-end fabrics d'IA et de HPC. |
Hypothèses : les performances sont comparées après optimisation (l'Ethernet non optimisé reste en retrait, l'Ethernet bien optimisé atteint la parité) ; le coût est exprimé sous forme de fourchette, jamais en valeur monétaire ; l'ouverture désigne un approvisionnement multi-fournisseurs, non un jugement de qualité ; Ultra Ethernet reflète une orientation à partir de 2025, et non un produit disponible. L'optimisation collective renvoie de manière générique aux bibliothèques xCCL. Ces éléments éclairent la décision ; validez tout choix de fabric avec un ingénieur IP Infusion.
Profil sans perte RoCEv2
RoCEv2 n'est pas une simple fonctionnalité de commutateur. Il s'agit d'un profil composé de PFC, ECN et ETS, DCQCN assurant le travail en régime permanent et PFC servant de garde-fou. Cet outil recommande les mécanismes ainsi que l'ordre dans lequel les appliquer pour votre conception. Il n'émet aucune valeur de seuil et n'intervient sur aucun équipement.
| Mechanism | Rôle dans le profil sans perte | Disponibilité d'OcNOS |
|---|---|---|
| PFC | Garantie sans perte de paquets pour la classe RoCE. Un garde-fou de dernier recours, non le mécanisme de contrôle principal. | Les 4 plateformes AI |
| ECN | Marque la congestion tôt afin que les émetteurs réduisent leur débit avant le débordement des files. Réglez son point de marquage en dessous du déclencheur PFC. | Les 4 plateformes AI |
| DCQCN (ECN + PFC) | Contrôle principal en régime établi. Le marquage ECN pilote la réaction DCQCN au niveau des NIC ; le PFC vient en renfort. Un mécanisme composé, non une fonctionnalité autonome. | Les 4 plateformes AI |
| ETS | Des garanties de bande passante et une isolation de classe afin que la classe sans perte ne soit pas privée de ressources par le trafic best-effort. | Les 4 plateformes AI |
| Watchdog anti-interblocage PFC | Détecte et rompt les situations d'interblocage ou de tempête de pause PFC : le filet de sécurité du dispositif de secours PFC. | Les 4, OcNOS 7.0 |
| DLB (équilibrage de charge dynamique) | Répartit les flux RoCE éléphants qui entrent en collision avec un ECMP statique. Fait passer l'utilisation de la fabric d'environ 55 pour cent à 90 pour cent et au-delà. | Les 4 plateformes AI |
| ECN dynamique | Adapte le marquage ECN aux conditions de file d'attente en temps réel, réduisant le réajustement manuel à mesure que la charge évolue. | TH5 uniquement, OcNOS 7.0 |
| DLB réactif / aléatoire | Modes de placement DLB avancés pour une répartition de flux plus serrée. Sur TH4, utilisez le DLB standard. | TH5 uniquement, OcNOS 7.0 |
| GLB (Global Load Balancing) | Répartition de charge à l'échelle de la fabric, au-delà des décisions DLB locales. | Feuille de route, train OcNOS 7.1 |
| Ultra Ethernet | Packet spray avec réordonnancement côté NIC et dépendance réduite au PFC, la trajectoire vers l'Ethernet AI lossless. | Feuille de route, profil UEC |
À titre indicatif uniquement. Ces recommandations ne sont poussées vers aucun équipement et aucune valeur de seuil n'est générée ici. La disponibilité est conforme à l'OcNOS-DC. Matrice de fonctionnalités and Liste de compatibilité matérielle. Validez par rapport aux plateformes sélectionnées et à la version d'OcNOS avant le déploiement.
Consommation de la fabric
Une plage de puissance typique pour les commutateurs de la fabric dans la conception dimensionnée. Plages uniquement, optiques incluses. Les commutateurs réseau ne représentent qu'une faible part de la puissance totale du cluster ; ce sont les GPU qui prédominent.
Refroidissement : le refroidissement par porte arrière ou par liquide direct est généralement envisagé au-delà d'environ 30 à 40 kW par baie, en raison de la densité des serveurs GPU et non du réseau. Il s'agit d'une orientation, non d'une charge thermique calculée. Les plages de puissance des commutateurs sont des valeurs typiques pour des châssis de classe 51,2T (Tomahawk 5) et 25,6T (Tomahawk 4) équipés d'optiques ; confirmez les chiffres exacts sur la fiche technique de chaque plateforme.
Plateformes OcNOS-DC correspondantes
La fabric exécute une image OcNOS-DC unique sur du matériel ouvert Broadcom Tomahawk. Voici les plateformes 800G et 400G prises en charge sur lesquelles elle se conçoit.




Cet outil fournit une estimation structurelle de conception réseau à des fins de planification uniquement. Il ne constitue ni une garantie de performance, ni une nomenclature, ni une estimation de coût. Les conceptions réelles dépendent de l'optimisation des rails, du nombre de NIC par GPU, du câblage et des choix de domaine de défaillance. Les nombres de GPU sont des plafonds de conception de référence issus du calcul de radix Clos, et non des valeurs mesurées. Broadcom et Tomahawk sont des marques de Broadcom Inc. ; les autres noms sont les marques de leurs détenteurs respectifs.
Conception de référence pour l'AI fabric
Obtenez le PDF de conception de référence : topologie, nombre de switchs, récapitulatif des composants et un profil de départ RoCEv2 sans perte.
Conception de référence pour l'AI fabric
Formulaire court : votre PDF se télécharge immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
Questions fréquentes
Comment dimensionner une leaf-spine fabric pour un cluster de GPU ?
Qu'est-ce qu'une topologie rail-optimized ?
Combien de transceivers une AI fabric nécessite-t-elle ?
RoCEv2 ou InfiniBand : lequel convient le mieux à l'IA ?
Comment rendre une AI fabric sans perte pour RoCEv2 ?
La même image OcNOS s'exécute-t-elle sur chaque commutateur de la fabric ?
Design the whole AI fabric with OcNOS
From the business case to the port-count maths, pick up wherever you are in the build.