Le réseau de la neocloud : un fabric pour l'entraînement et l'inférence IA
Une neocloud exécute l'entraînement et l'inférence sur la même infrastructure. IP Infusion fournit le réseau ouvert pour les deux : OcNOS sur du matériel ouvert validé, du RoCEv2 sans perte pour les clusters GPU, de l'inférence distribuée en périphérie et un transport ouvert entre sites, depuis un seul plan de contrôle et un seul contrat de support.
L'entraînement et l'inférence tirent le réseau dans des directions opposées
Chaque neocloud sert les deux. L'entraînement remplit quelques grands clusters d'un trafic régulier et synchronisé. L'inférence se répartit sur de nombreux sites et grimpe sans prévenir. Le fabric doit rendre justice aux deux, sinon les charges de travail qui paient les factures iront ailleurs.
| Ce que voit le réseau | Entraînementl'usine d'IA | Inférencele service en temps réel |
|---|---|---|
| Empreinte | Quelques grands clusters GPU | De nombreux sites régionaux et en périphérie |
| Trafic | Trafic collectif GPU à GPU massif et synchronisé | Petites requêtes sensibles à la latence |
| Profil de charge | Utilisation GPU soutenue et quasi totale sur de longues durées | En rafales et élastique, avec des pics en quelques secondes |
| Le réseau doit être | Sans perte sous une bande passante soutenue | Faible latence et redondance à chaque couche |
| Tolérance aux pannes | Tolérant, les jobs font des points de contrôle et reprennent | Faible, des SLA stricts sur chaque requête |
Un fabric, ou deux ?
Chaque neocloud répond à la même question : combien de réseaux construit-elle pour servir l'entraînement et l'inférence ? La réponse façonne la base de coûts pendant toute la durée du déploiement.
Un réseau d'entraînement, plus un second pour l'inférence
Un fabric pour l'entraînement, un autre greffé pour l'inférence. Deux conceptions, deux stocks de pièces, deux équipes d'exploitation, deux cycles de mise à niveau. Les coûts d'investissement et d'exploitation sont doublés avant l'arrivée du premier client, et la marge doit tout absorber.
Entraînement et inférence sur un seul plan de contrôle
Les deux charges de travail s'exécutent sur le même réseau OcNOS. Une image, un plan de contrôle, un contrat de support. Le fabric d'entraînement et les sites d'inférence distribuée sont la même plateforme, dimensionnée et licenciée par rôle, de sorte que l'opérateur capte l'entraînement et chaque charge d'inférence qui suit sur l'infrastructure qu'il possède déjà.

Un fabric Ethernet sans perte pour les clusters GPU
L'entraînement déplace un trafic massif et synchronisé entre GPU, le fabric doit donc rester sans perte sous charge. OcNOS exécute la boîte à outils RoCEv2 sur du silicium marchand ouvert jusqu'à 800G, de sorte que l'usine d'IA obtient un fabric Ethernet à haut radix sans pile mono-fournisseur.
RoCEv2 sans perte
Priority flow control, ECN, and DCQCN maintiennent le trafic collectif GPU à l'abri de la perte de paquets, avec un équilibrage de charge adaptatif pour le répartir sur le fabric.
Jusqu'à 800G sur silicium ouvert
Ethernet à haut radix sur du matériel ouvert validé de plusieurs fournisseurs porte le fabric d'entraînement, avec la marge pour étendre le cluster.
Prêt pour la pile GPU
Le fabric transporte les GPU collective libraries (NCCL, RCCL, oneCCL) sur lesquelles s'exécutent les jobs d'entraînement, afin que le réseau ne soit pas le goulot d'étranglement de l'AllReduce.
La même image OcNOS s'exécute à chaque palier, si bien que le fabric évolue avec le cluster au lieu d'être reconçu à chaque étape.
L'inférence vit en périphérie et a besoin que le réseau suive
L'inférence se répartit sur de nombreux sites régionaux et en périphérie, monte et descend rapidement en charge et tient des objectifs de latence stricts. Ici, une neocloud a besoin de plus qu'un fabric de centre de données : il lui faut du transport entre les sites et de l'assurance sur l'ensemble. IP Infusion couvre tout le chemin.
Fabric de centre de données sur chaque site
An Leaf-spine EVPN-VXLAN sur des switches ouverts dessert chaque site d'inférence, avec l'élasticité pour ajouter et retirer de la capacité selon la demande.
Transport ouvert entre sites
Un transport à faible latence relie les sites. IP over DWDM with coherent ZR and ZR+ fusionne la couche optique sur le routeur pour la capacité de site à site.
Assurance sur chaque site
IP Maestro donne une vue unique de l'ensemble du parc, afin qu'un opérateur tienne les niveaux de service d'inférence sur de nombreux sites et des conceptions N+1.
Une base de coûts qu'une neocloud peut défendre
Une neocloud se bat sur le prix et la vitesse de mise à l'échelle, le réseau ne peut donc pas être une taxe propriétaire. L'open networking met l'opérateur aux commandes du matériel, du logiciel et des délais, tandis qu'un seul fournisseur reste responsable du logiciel et du support.
Chaîne d'approvisionnement multifournisseur
Switches from Edgecore, UfiSpace et d'autres exécutent la même image OcNOS, de sorte que l'opérateur n'est jamais lié à un fournisseur pour le matériel ou les délais.
Coût matériel réduit
OcNOS sur des switches en silicium marchand ouvert porte l'AI fabric à un coût matériel inférieur de 40 à 60 % par rapport aux plateformes propriétaires à débits de port et radix comparables.
Un seul fournisseur assume la correction
Le matériel et le logiciel se renouvellent selon des cycles indépendants, mais un seul contrat de support couvre le système complet, de sorte qu'une seule équipe assume la correction.
Le réseau ouvert fonctionne déjà à grande échelle
Le fabric neocloud n'est pas un exercice de laboratoire. Il fait tourner le même OcNOS qui porte le trafic de production d'opérateurs partout dans le monde, sur le même matériel ouvert.
Le réseau neocloud, expliqué
Qu'est-ce qu'une neocloud ?
Les neoclouds utilisent-elles InfiniBand ou Ethernet ?
Une neocloud doit-elle construire un ou deux réseaux pour l'entraînement et l'inférence ?
Quand une neocloud a-t-elle malgré tout besoin de deux réseaux distincts ?
De quoi l'inférence distribuée a-t-elle besoin du réseau ?
Comment l'open networking réduit-il le coût d'une neocloud ?
Emportez la fiche technique OcNOS-DC
Un téléchargement court et technique qui va plus loin que cette page : la fiche technique complète OcNOS-DC.
Datasheet OcNOS-DC
Formulaire rapide. Votre PDF s'ouvre dans un nouvel onglet immédiatement après l'envoi.
✓ Ouverture de votre PDF dans un nouvel onglet…
S'il ne s'est pas ouvert, utilisez le lien ci-dessous.
Concevez votre fabric neocloud avec un seul plan de contrôle
Indiquez-nous l'échelle GPU et les sites que vous prévoyez de desservir, et un ingénieur IP Infusion vous aidera à concevoir un fabric ouvert pour l'entraînement et l'inférence.
Souhaitez-vous que nous vous contactions ?
Laissez vos coordonnées et un ingénieur IP Infusion vous aidera à concevoir un fabric ouvert pour l'entraînement et l'inférence IA. Nous ne vous contacterons que si vous le souhaitez.