Definizione di networking · RDMA · RoCEv2

Cos'è un fabric IA?

Un fabric IA è la rete back-end GPU (scale-out) che trasporta il traffico RDMA tra le GPU durante l'addestramento e l'inferenza distribuiti. It connects every GPU NIC across servers and pods using leaf and spine switches in rail-optimized and Clos topologies, and it runs a lossless Ethernet transport (RoCEv2 with PFC and ECN) so no packet is dropped under load. Because GPUs exchange data in lockstep collectives, the fabric's tail latency sets job completion time. This is the networking sense, not the enterprise "data fabric" used in data management. OcNOS-DC provides this fabric on Broadcom Tomahawk 5 hardware.

RoCEv2trasporto Ethernet lossless
51,2 TbpsTomahawk 5, 64x800G
16,000+GPU, Clos a 3 stadi
OcNOS-DCun NOS su hardware aperto
Due significati, una parola

Il significato relativo al networking, non il "data fabric"

Due campi diversi usano la parola "fabric". Un data fabric è un'architettura software per unificare e governare i dati in tutta un'azienda. Un fabric IA, l'oggetto di questa pagina, è una rete fisica: i cavi, gli switch e il trasporto che spostano il traffico RDMA tra le GPU. Quando un team di infrastruttura IA dice "il fabric era il collo di bottiglia", intende questa rete, quella che ha deciso quanto è durato il processo di addestramento.

  • Data fabric. Un'architettura aziendale di gestione dei dati per unificarli e governarli tra i sistemi. Software, non cavi.
  • AI fabric. La rete fisica back-end GPU che trasporta RDMA tra le GPU durante l'addestramento e l'inferenza. Questa pagina riguarda questo significato.
  • Perché è importante. Il fabric IA è quello che determina il tempo di completamento del job, quindi è progettato per restare lossless e caricato in modo uniforme.
Come è costruito il fabric

Rail, Clos e un trasporto che non può scartare

Un fabric IA è una rete leaf-spine (Clos) ottimizzata per un unico pattern di traffico: molte GPU che si inviano contemporaneamente flussi di grandi dimensioni. Tre scelte di design lo definiscono, e ognuna esiste per proteggere il tempo di completamento del job.

Topologia

Rail-optimized, poi Clos a 3 stadi

Each of a GPU server's 8 NICs connects to its own leaf rail dedicato, così il traffico AllReduce dominante sullo stesso rail resta su un unico leaf. Oltre il singolo pod, il design si estende a un Clos a 3 stadi di leaf, spine e super-spine.

Transport

RoCEv2 lossless

Le GPU spostano i dati con RDMA, che offre prestazioni scarse quando i pacchetti vengono scartati. PFC impedisce a una coda di switch di andare in overflow e ECN marca i pacchetti in anticipo così la NIC mittente rallenta prima che si verifichi la perdita. Questa combinazione trasporta RoCEv2 su Ethernet.

Behaviour

Perché deve essere lossless

OcNOS-DC fornisce questo fabric con PFC (anche su L3), ECN, ECN Dinamico, WRED, e bilanciamento dinamico del carico per mantenere ogni percorso caricato in modo uniforme, perché il flusso di coda decide quando termina l'intero job.

Dove si colloca

Ethernet è sufficiente, e lo switch fissa il tetto

Il fabric IA oggi è una rete Ethernet. Ciò che può raggiungere è determinato dal silicio dello switch sottostante e dal numero di GPU per cui progetti.

  • Ethernet è sufficiente. RoCEv2 con PFC ed ECN offre RDMA lossless su hardware standard e multi-vendor. Meta ha pubblicato un cluster di addestramento da 24.000 GPU costruito su Ethernet.
  • Lo switch fissa il tetto. OcNOS-DC gira su piattaforme Broadcom Tomahawk 5 (51,2 Tbps, 64x800G) come l'Edgecore AIS800-64D e l'UfiSpace S9321-64E, la densità richiesta da un fabric GPU a 800G.
  • Progetta in base al numero di GPU. Rail-optimized single pod up to roughly 1,000 GPUs, then a 3-stage Clos to 16,000+ and up to about 65,536 at the fat-tree limit.
FAQ

FAQ: Cos'è un fabric IA

Cos'è una AI fabric?
Nel networking, un fabric IA è la rete back-end GPU (scale-out) che trasporta il traffico RDMA tra le GPU durante l'addestramento e l'inferenza distribuiti. Collega le NIC GPU di ogni server e pod così che un'operazione collettiva come AllReduce si completi con la stessa rapidità consentita dal collegamento più lento. È costruito con switch leaf e spine in topologie rail-optimized e Clos, ed esegue un trasporto Ethernet lossless (RoCEv2 con PFC ed ECN). OcNOS-DC fornisce quel fabric su hardware Broadcom Tomahawk 5.
Un fabric IA è la stessa cosa di un data fabric?
No. Sono termini diversi che condividono una parola. Un data fabric è un'architettura aziendale di gestione dei dati per unificarli e governarli tra i sistemi. Un fabric IA, nel significato di networking qui usato, è una rete fisica back-end GPU che sposta il traffico RDMA tra le GPU. Questa pagina riguarda il significato relativo al networking.
Perché il fabric IA decide il tempo di completamento del job?
L'addestramento GPU procede in modo sincronizzato. Dopo ogni passaggio, le GPU scambiano i gradienti in un collettivo, e ogni GPU attende il completamento di quello scambio prima che inizi il passaggio successivo. Se un collegamento si blocca o scarta un pacchetto, l'intero job attende. Poiché il fabric trasporta ognuno di questi scambi, è la sua tail latency, non la media, a determinare quanto dura un processo di addestramento, ed è per questo che il fabric è progettato per restare lossless e caricato in modo uniforme.
Ho bisogno di InfiniBand, o Ethernet è sufficiente per un fabric IA?
Ethernet è oggi un trasporto di prima classe per il fabric IA. RoCEv2 con PFC ed ECN offre RDMA lossless su hardware standard e multi-vendor, e Meta ha pubblicato un cluster di addestramento da 24.000 GPU costruito su Ethernet. OcNOS-DC esegue oggi quel fabric RoCEv2 e si allinea al profilo di fabric Ultra Ethernet Consortium 1.0 per la prossima generazione di endpoint.

Stai costruendo un fabric IA? Dimensioniamolo insieme.

Indicaci la scala GPU e il workload, e un ingegnere IP Infusion elaborerà con te la topologia e i calcoli sulle porte su hardware aperto Tomahawk 5 con OcNOS-DC.