Neocloud · AI training and inference

Rete per la neocloud: un fabric per training e inferenza IA

Una neocloud esegue training e inferenza sulla stessa infrastruttura. IP Infusion fornisce la rete aperta per entrambi: OcNOS su hardware aperto validato, RoCEv2 lossless per i cluster GPU, inferenza distribuita all'edge e trasporto aperto tra le sedi, da un solo control plane e un solo contratto di supporto.

1 fabrictraining e inferenza
fino a 800GAI fabric Ethernet
dal 40 al 60%minori costi hardware
600+reti di operatori
Due workload, un business

Training e inferenza tirano la rete in direzioni opposte

Ogni neocloud serve entrambi. Il training riempie pochi grandi cluster con traffico costante e sincronizzato. L'inferenza si distribuisce su molte sedi e cresce senza preavviso. Il fabric deve rendere giustizia a entrambi, altrimenti i workload che pagano le bollette andranno altrove.

Training e inferenza a confronto, secondo le metriche di rete che definiscono il fabric.
Ciò che vede la rete Trainingla fabbrica di IA Inferenzail servizio in tempo reale
PresenzaPochi grandi cluster GPUMolte sedi regionali ed edge
TrafficoCollettivi GPU-GPU massivi e sincronizzatiRichieste piccole e critiche per la latenza
Profilo di caricoUtilizzo GPU sostenuto e quasi totale per esecuzioni lungheA raffiche ed elastico, con picchi in pochi secondi
La rete deve essereLossless con banda sostenutaBassa latenza e ridondanza a ogni livello
Tolleranza ai guastiTollerante, i job creano checkpoint e riprendonoBassa, SLA rigorosi su ogni richiesta
La decisione di rete che definisce il tuo margine

Un fabric o due?

Ogni neocloud risponde alla stessa domanda: quante reti costruisce per servire training e inferenza? La risposta definisce la base di costo per tutta la vita del progetto.

Option A · two networks

Una rete di training, più una seconda per l'inferenza

Un fabric per il training, un altro aggiunto per l'inferenza. Due progetti, due scorte di ricambi, due team operativi, due cicli di aggiornamento. I costi di capitale e operativi si duplicano prima dell'arrivo del primo cliente, e il margine deve assorbire tutto.

Capex e opex duplicati, margine sotto pressione
Option B · one OcNOS fabric

Training e inferenza su un solo control plane

Entrambi i workload girano sulla stessa rete OcNOS. Un'immagine, un control plane, un contratto di supporto. Il fabric di training e le sedi di inferenza distribuita sono la stessa piattaforma, dimensionata e licenziata per ruolo, così l'operatore cattura il training e ogni successivo workload di inferenza sull'infrastruttura che già possiede.

Un fabric, con costi che scalano con il business
Un fabric OcNOS per una neocloud: a sinistra un cluster di training GPU leaf-spine con RoCEv2 lossless fino a 800G, a destra sedi di inferenza distribuita, collegate da trasporto aperto IP over DWDM, tutto sotto un solo control plane OcNOS.
Un fabric OcNOS per training e inferenza: un cluster di training GPU con RoCEv2 lossless, sedi di inferenza distribuita e trasporto aperto tra loro, sotto un solo control plane.
Il fabric di training

Un fabric Ethernet lossless per i cluster GPU

Il training sposta traffico massivo e sincronizzato tra le GPU, quindi il fabric deve restare lossless sotto carico. OcNOS esegue il toolkit RoCEv2 su silicio merchant aperto fino a 800G, così la fabbrica di IA ottiene un fabric Ethernet ad alto radix senza uno stack di un solo fornitore.

RoCEv2 lossless

Priority flow control, ECN, and DCQCN mantengono il traffico collettivo GPU al riparo dalla perdita di pacchetti, con bilanciamento del carico adattivo per distribuirlo nel fabric.

Fino a 800G su silicio aperto

Ethernet ad alto radix su hardware aperto validato di più fornitori sostiene il fabric di training, con margine per scalare il cluster.

Pronto per lo stack GPU

Il fabric trasporta le GPU collective libraries (NCCL, RCCL, oneCCL) su cui girano i job di training, così la rete non è il collo di bottiglia nell'AllReduce.

Un'unica immagine, ogni livello di scala
Rack
Server GPU + leaf
L'unità con cui aggiungi capacità: server GPU dietro un leaf top-of-rack.
Pod
Blocco leaf-spine
Un blocco leaf-spine non bloccante, il mattone ripetibile del fabric.
Cluster
Fino a 4,096 GPU
Un cluster di training completo su un fabric RoCEv2 lossless.
Multi-cluster
Design da 16,384 GPU
Più cluster e sedi di inferenza distribuita, sotto un unico control plane.

La stessa immagine OcNOS gira a ogni livello, così il fabric scala con il cluster invece di essere riprogettato a ogni passo.

Inferenza distribuita

L'inferenza vive all'edge e ha bisogno che la rete la segua

L'inferenza si distribuisce su molte sedi regionali ed edge, scala rapidamente in su e in giù e mantiene obiettivi di latenza stretti. Qui una neocloud ha bisogno di più di un fabric di data center: serve trasporto tra le sedi e assurance su tutte. IP Infusion copre l'intero percorso.

Fabric di data center in ogni sede

An Leaf-spine EVPN-VXLAN su switch aperti serve ogni sede di inferenza, con l'elasticità di aggiungere e rimuovere capacità al variare della domanda.

Trasporto aperto tra le sedi

Il trasporto a bassa latenza collega le sedi. IP over DWDM with coherent ZR and ZR+ integra il livello ottico nel router per la capacità tra le sedi.

Assurance su ogni sede

IP Maestro offre un'unica vista dell'intero footprint, così un operatore mantiene i livelli di servizio dell'inferenza su molte sedi e progetti N+1.

Hardware aperto, costi inferiori

Una base di costo che una neocloud può difendere

Una neocloud compete su prezzo e velocità di scalata, quindi la rete non può essere una tassa proprietaria. L'open networking mette l'operatore al comando di hardware, software e tempi di consegna, mentre un solo fornitore resta responsabile di software e supporto.

Supply chain multi-fornitore

Switches from Edgecore, UfiSpace e altri eseguono la stessa immagine OcNOS, così l'operatore non è mai legato a un fornitore per hardware o tempi di consegna.

Minori costi hardware

OcNOS su switch in silicio merchant aperto sostiene l'AI fabric con un costo hardware inferiore del 40-60% rispetto alle piattaforme proprietarie a parità di velocità di porta e radix.

Un solo fornitore risponde della soluzione

Hardware e software si rinnovano su cicli indipendenti, ma un solo contratto di supporto copre l'intero sistema, così un solo team risponde della soluzione.

Comprovato in produzione

La rete aperta è già in esecuzione su larga scala

Il fabric neocloud non è un esercizio da laboratorio. Esegue lo stesso OcNOS che trasporta traffico di produzione per operatori di tutto il mondo, sullo stesso hardware aperto.

600+
reti di operatori girano su OcNOS presso service provider, data center e internet exchange.
60+
paesi in cui OcNOS trasporta oggi traffico di produzione dal vivo.
40+
piattaforme hardware aperte validate eseguono OcNOS da un'unica immagine.
FAQ

Il networking per neocloud, spiegato

Che cos'è una neocloud?
Una neocloud è un provider cloud AI-first costruito attorno a un denso calcolo GPU per training e inferenza, anziché sui servizi generici di un hyperscaler tradizionale. Le neocloud competono su prestazioni pure degli acceleratori, velocità di scalata e costo, quindi la rete che trasporta il traffico GPU è un elemento centrale dell'economia, non un ripensamento.
Le neocloud usano InfiniBand o Ethernet?
Entrambi vengono impiegati e, con l'arrivo dei 800G, l'industria si sta orientando verso Ethernet. Ethernet con RoCEv2 trasporta il traffico collettivo GPU su silicio merchant aperto, così una neocloud ottiene un AI fabric lossless senza uno stack di un solo fornitore. OcNOS esegue l'intero toolkit RoCEv2, priority flow control, ECN e bilanciamento del carico adattivo, su hardware aperto validato.
Una neocloud dovrebbe costruire una rete o due per training e inferenza?
Training e inferenza sono workload opposti: il training è centralizzato e avido di banda, l'inferenza è distribuita, a raffiche e critica per la latenza. Costruire due reti separate duplica i costi di capitale e operativi. Eseguire entrambe su un solo fabric OcNOS con un control plane consente a una neocloud di servire il training e ogni workload di inferenza dalla stessa infrastruttura, ed è lì che il margine operativo migliora.
Quando una neocloud ha comunque bisogno di due reti separate?
Alcuni operatori separano training e inferenza di proposito, e per buone ragioni: isolamento rigoroso tra tenant, domini operativi distinti per team diversi, un confine di prestazioni netto o un'isola InfiniBand esistente che già gestisce il training. OcNOS funziona in entrambi i casi. Il punto è che la separazione deve essere una scelta progettuale deliberata, non un costo che l'architettura ti impone. Quando un solo team può eseguire entrambi i carichi su un unico control plane, un fabric dimensionato e licenziato per ruolo è la scelta predefinita che protegge il margine.
Di cosa ha bisogno l'inferenza distribuita dalla rete?
L'inferenza si distribuisce su molte sedi regionali ed edge, scala rapidamente in su e in giù e mantiene obiettivi di latenza stretti, quindi la rete ha bisogno di capacità elastica, ridondanza a ogni livello e trasporto a bassa latenza tra le sedi. IP Infusion copre l'intero percorso: il fabric di data center, il trasporto e l'IP over DWDM tra le sedi, e IP Maestro per l'assurance.
Come riduce l'open networking il costo di una neocloud?
Una neocloud acquista switch e software su cicli indipendenti da una supply chain multi-fornitore, quindi non è legata a un fornitore per hardware, software o tempi di consegna. OcNOS su switch in silicio merchant aperto sostiene l'AI fabric con un costo hardware inferiore rispetto alle piattaforme proprietarie, e un solo fornitore resta responsabile di software e supporto sotto un unico contratto.

Progetta il tuo fabric neocloud con un solo control plane

Indicaci la scala GPU e le sedi che intendi servire, e un tecnico IP Infusion ti aiuterà a progettare un fabric aperto per training e inferenza.