Rete per la neocloud: un fabric per training e inferenza IA
Una neocloud esegue training e inferenza sulla stessa infrastruttura. IP Infusion fornisce la rete aperta per entrambi: OcNOS su hardware aperto validato, RoCEv2 lossless per i cluster GPU, inferenza distribuita all'edge e trasporto aperto tra le sedi, da un solo control plane e un solo contratto di supporto.
Training e inferenza tirano la rete in direzioni opposte
Ogni neocloud serve entrambi. Il training riempie pochi grandi cluster con traffico costante e sincronizzato. L'inferenza si distribuisce su molte sedi e cresce senza preavviso. Il fabric deve rendere giustizia a entrambi, altrimenti i workload che pagano le bollette andranno altrove.
| Ciò che vede la rete | Trainingla fabbrica di IA | Inferenzail servizio in tempo reale |
|---|---|---|
| Presenza | Pochi grandi cluster GPU | Molte sedi regionali ed edge |
| Traffico | Collettivi GPU-GPU massivi e sincronizzati | Richieste piccole e critiche per la latenza |
| Profilo di carico | Utilizzo GPU sostenuto e quasi totale per esecuzioni lunghe | A raffiche ed elastico, con picchi in pochi secondi |
| La rete deve essere | Lossless con banda sostenuta | Bassa latenza e ridondanza a ogni livello |
| Tolleranza ai guasti | Tollerante, i job creano checkpoint e riprendono | Bassa, SLA rigorosi su ogni richiesta |
Un fabric o due?
Ogni neocloud risponde alla stessa domanda: quante reti costruisce per servire training e inferenza? La risposta definisce la base di costo per tutta la vita del progetto.
Una rete di training, più una seconda per l'inferenza
Un fabric per il training, un altro aggiunto per l'inferenza. Due progetti, due scorte di ricambi, due team operativi, due cicli di aggiornamento. I costi di capitale e operativi si duplicano prima dell'arrivo del primo cliente, e il margine deve assorbire tutto.
Training e inferenza su un solo control plane
Entrambi i workload girano sulla stessa rete OcNOS. Un'immagine, un control plane, un contratto di supporto. Il fabric di training e le sedi di inferenza distribuita sono la stessa piattaforma, dimensionata e licenziata per ruolo, così l'operatore cattura il training e ogni successivo workload di inferenza sull'infrastruttura che già possiede.

Un fabric Ethernet lossless per i cluster GPU
Il training sposta traffico massivo e sincronizzato tra le GPU, quindi il fabric deve restare lossless sotto carico. OcNOS esegue il toolkit RoCEv2 su silicio merchant aperto fino a 800G, così la fabbrica di IA ottiene un fabric Ethernet ad alto radix senza uno stack di un solo fornitore.
RoCEv2 lossless
Priority flow control, ECN, and DCQCN mantengono il traffico collettivo GPU al riparo dalla perdita di pacchetti, con bilanciamento del carico adattivo per distribuirlo nel fabric.
Fino a 800G su silicio aperto
Ethernet ad alto radix su hardware aperto validato di più fornitori sostiene il fabric di training, con margine per scalare il cluster.
Pronto per lo stack GPU
Il fabric trasporta le GPU collective libraries (NCCL, RCCL, oneCCL) su cui girano i job di training, così la rete non è il collo di bottiglia nell'AllReduce.
La stessa immagine OcNOS gira a ogni livello, così il fabric scala con il cluster invece di essere riprogettato a ogni passo.
L'inferenza vive all'edge e ha bisogno che la rete la segua
L'inferenza si distribuisce su molte sedi regionali ed edge, scala rapidamente in su e in giù e mantiene obiettivi di latenza stretti. Qui una neocloud ha bisogno di più di un fabric di data center: serve trasporto tra le sedi e assurance su tutte. IP Infusion copre l'intero percorso.
Fabric di data center in ogni sede
An Leaf-spine EVPN-VXLAN su switch aperti serve ogni sede di inferenza, con l'elasticità di aggiungere e rimuovere capacità al variare della domanda.
Trasporto aperto tra le sedi
Il trasporto a bassa latenza collega le sedi. IP over DWDM with coherent ZR and ZR+ integra il livello ottico nel router per la capacità tra le sedi.
Assurance su ogni sede
IP Maestro offre un'unica vista dell'intero footprint, così un operatore mantiene i livelli di servizio dell'inferenza su molte sedi e progetti N+1.
Una base di costo che una neocloud può difendere
Una neocloud compete su prezzo e velocità di scalata, quindi la rete non può essere una tassa proprietaria. L'open networking mette l'operatore al comando di hardware, software e tempi di consegna, mentre un solo fornitore resta responsabile di software e supporto.
Supply chain multi-fornitore
Switches from Edgecore, UfiSpace e altri eseguono la stessa immagine OcNOS, così l'operatore non è mai legato a un fornitore per hardware o tempi di consegna.
Minori costi hardware
OcNOS su switch in silicio merchant aperto sostiene l'AI fabric con un costo hardware inferiore del 40-60% rispetto alle piattaforme proprietarie a parità di velocità di porta e radix.
Un solo fornitore risponde della soluzione
Hardware e software si rinnovano su cicli indipendenti, ma un solo contratto di supporto copre l'intero sistema, così un solo team risponde della soluzione.
La rete aperta è già in esecuzione su larga scala
Il fabric neocloud non è un esercizio da laboratorio. Esegue lo stesso OcNOS che trasporta traffico di produzione per operatori di tutto il mondo, sullo stesso hardware aperto.
Il networking per neocloud, spiegato
Che cos'è una neocloud?
Le neocloud usano InfiniBand o Ethernet?
Una neocloud dovrebbe costruire una rete o due per training e inferenza?
Quando una neocloud ha comunque bisogno di due reti separate?
Di cosa ha bisogno l'inferenza distribuita dalla rete?
Come riduce l'open networking il costo di una neocloud?
Porta con te la scheda tecnica OcNOS-DC
Un download breve e tecnico che va oltre questa pagina: la scheda tecnica completa OcNOS-DC.
Datasheet OcNOS-DC
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
Progetta il tuo fabric neocloud con un solo control plane
Indicaci la scala GPU e le sedi che intendi servire, e un tecnico IP Infusion ti aiuterà a progettare un fabric aperto per training e inferenza.
Desidera essere ricontattato?
Lascia i tuoi dati e un tecnico IP Infusion ti aiuterà a progettare un fabric aperto per training e inferenza IA. Ti contatteremo solo se lo desideri.