Cos'è un fabric GPU?
Un fabric GPU è la rete back-end che interconnette le GPU tra server e pod affinché possano lavorare insieme su un unico job di addestramento o inferenza. Trasporta il traffico RDMA che le GPU scambiano durante le operazioni collettive, separato dalla rete front-end usata per gestione e storage. È la rete scale-out che inizia dove termina il dominio scale-up all'interno del server, come NVLink, costruita a partire da topologie rail-optimized e Clos che eseguono RoCEv2 lossless, e OcNOS-DC la fornisce su hardware Broadcom Tomahawk 5.
Lo scale-up termina, lo scale-out inizia
Un fabric GPU si trova da un lato di un confine netto. All'interno di un server, il dominio scale-up opera a velocità dell'ordine dei terabit; tra i server, il fabric GPU scale-out trasporta il resto. Un collettivo usa prima lo scale-up all'interno del dominio, poi questo fabric trasporta il traffico tra i server.
Dominio scale-up
L'interconnessione a larghissima banda all'interno di un server GPU e del suo dominio strettamente accoppiato, per esempio NVLink all'interno di un rack NVL72. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.
Fabric GPU scale-out
La rete Ethernet tra server e pod attraverso i livelli rail, leaf, spine e Clos. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.
Rail e Clos
La maggior parte dei fabric GPU sono reti leaf-spine rail-optimized: ciascuna delle 8 NIC di un server GPU si collega al proprio leaf rail dedicato, così il traffico AllReduce dominante sullo stesso rail resta su un unico leaf e non attraversa mai lo spine. Oltre il singolo pod, il design si estende a un Clos a 3 stadi con un livello super-spine.
Leaf rail-optimized
Ciascuna delle 8 NICs di un server si mappa sul proprio leaf rail, mantenendo il traffico AllReduce dominante sullo stesso rail su un unico leaf e fuori dallo spine.
Scala Clos a 3 stadi
Su Tomahawk 5 radix-64, un fabric a 2 livelli raggiunge circa 2,048 GPUs in modalità non bloccante 1:1; un Clos a 3 stadi scala fino a 16.000+ GPU.
Trasporto RoCEv2 lossless
Il piano GPU trasporta RDMA su RoCEv2, progettato lossless così che un collettivo non si blocchi mai su un pacchetto scartato.
RoCEv2 lossless, e OcNOS-DC lo fornisce
Le GPU spostano i dati con RDMA su RoCEv2, che offre prestazioni scarse in caso di perdita di pacchetti. Perciò il fabric GPU è progettato lossless e mantenuto caricato in modo uniforme, così che nessun collegamento diventi un punto critico durante un collettivo. OcNOS-DC fornisce esattamente questo su Broadcom Tomahawk 5, come abilitatore per hardware aperto e multi-vendor.
- Progettato lossless con Priority Flow Control (anche su L3) ed ECN, così che un passaggio di addestramento non si blocchi mai su un pacchetto scartato.
- Mantenuto caricato in modo uniforme con ECN Dinamico e DLB, così che nessun singolo collegamento diventi un punto critico durante un collettivo.
- Fornito da OcNOS-DC su piattaforme Broadcom Tomahawk 5 (51,2 Tbps, 64x800G) come l'Edgecore AIS800-64D e l'UfiSpace S9321-64E.
FAQ: Cos'è un fabric GPU
Cos'è una GPU fabric?
Qual è la differenza tra scale-up e scale-out?
Quale topologia usa un fabric GPU?
Un fabric GPU deve essere lossless?
Approfondite. Portatelo con voi.
Due download brevi e tecnici che vanno oltre questa pagina: il datasheet completo di OcNOS-DC e l'architettura del fabric IA lossless a 800G.
Datasheet OcNOS-DC
Specifica completa di OcNOS-DC: il set di funzionalità EVPN-VXLAN e Ethernet for AI, gli SKU software, le piattaforme hardware supportate e la guida all'ordine della soluzione.
Ottieni il datasheetOcNOS 800G Lossless AI Fabric
Fabric RoCEv2 non bloccante su spine Broadcom Tomahawk 4/5: tier di SKU, piattaforme validate e architettura di deployment.
Scarica il briefDatasheet OcNOS-DC
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
OcNOS 800G Lossless AI Fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
Stai realizzando un fabric GPU? Dimensioniamo il piano insieme.
Indicaci il numero di GPU e il workload, e un ingegnere IP Infusion elaborerà con te i calcoli sulle porte, oppure inizia da un layout rail-optimized di prima approssimazione nell'AI Fabric Design Suite.
Progettate l'intero fabric AI con OcNOS
Dal business case al calcolo del numero di porte, riprendete da qualunque punto della realizzazione.