Definizione di networking · Scale-out · RoCEv2

Cos'è un fabric GPU?

Un fabric GPU è la rete back-end che interconnette le GPU tra server e pod affinché possano lavorare insieme su un unico job di addestramento o inferenza. Trasporta il traffico RDMA che le GPU scambiano durante le operazioni collettive, separato dalla rete front-end usata per gestione e storage. È la rete scale-out che inizia dove termina il dominio scale-up all'interno del server, come NVLink, costruita a partire da topologie rail-optimized e Clos che eseguono RoCEv2 lossless, e OcNOS-DC la fornisce su hardware Broadcom Tomahawk 5.

~2,048 GPUs2 tier, 1:1 non-blocking
16.000+ GPUScala Clos a 3 stadi
51,2 TbpsTomahawk 5 · 64x800G
1 NOSOcNOS-DC su hardware aperto
Dove inizia il fabric

Lo scale-up termina, lo scale-out inizia

Un fabric GPU si trova da un lato di un confine netto. All'interno di un server, il dominio scale-up opera a velocità dell'ordine dei terabit; tra i server, il fabric GPU scale-out trasporta il resto. Un collettivo usa prima lo scale-up all'interno del dominio, poi questo fabric trasporta il traffico tra i server.

All'interno del server

Dominio scale-up

L'interconnessione a larghissima banda all'interno di un server GPU e del suo dominio strettamente accoppiato, per esempio NVLink all'interno di un rack NVL72. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.

Tra i server

Fabric GPU scale-out

La rete Ethernet tra server e pod attraverso i livelli rail, leaf, spine e Clos. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.

Come è strutturato il fabric

Rail e Clos

La maggior parte dei fabric GPU sono reti leaf-spine rail-optimized: ciascuna delle 8 NIC di un server GPU si collega al proprio leaf rail dedicato, così il traffico AllReduce dominante sullo stesso rail resta su un unico leaf e non attraversa mai lo spine. Oltre il singolo pod, il design si estende a un Clos a 3 stadi con un livello super-spine.

Leaf rail-optimized

Ciascuna delle 8 NICs di un server si mappa sul proprio leaf rail, mantenendo il traffico AllReduce dominante sullo stesso rail su un unico leaf e fuori dallo spine.

Scala Clos a 3 stadi

Su Tomahawk 5 radix-64, un fabric a 2 livelli raggiunge circa 2,048 GPUs in modalità non bloccante 1:1; un Clos a 3 stadi scala fino a 16.000+ GPU.

Trasporto RoCEv2 lossless

Il piano GPU trasporta RDMA su RoCEv2, progettato lossless così che un collettivo non si blocchi mai su un pacchetto scartato.

Sul piano GPU

RoCEv2 lossless, e OcNOS-DC lo fornisce

Le GPU spostano i dati con RDMA su RoCEv2, che offre prestazioni scarse in caso di perdita di pacchetti. Perciò il fabric GPU è progettato lossless e mantenuto caricato in modo uniforme, così che nessun collegamento diventi un punto critico durante un collettivo. OcNOS-DC fornisce esattamente questo su Broadcom Tomahawk 5, come abilitatore per hardware aperto e multi-vendor.

  • Progettato lossless con Priority Flow Control (anche su L3) ed ECN, così che un passaggio di addestramento non si blocchi mai su un pacchetto scartato.
  • Mantenuto caricato in modo uniforme con ECN Dinamico e DLB, così che nessun singolo collegamento diventi un punto critico durante un collettivo.
  • Fornito da OcNOS-DC su piattaforme Broadcom Tomahawk 5 (51,2 Tbps, 64x800G) come l'Edgecore AIS800-64D e l'UfiSpace S9321-64E.
FAQ

FAQ: Cos'è un fabric GPU

Cos'è una GPU fabric?
Un fabric GPU è la rete back-end che interconnette le GPU tra server e pod affinché possano lavorare insieme su un unico job di addestramento o inferenza. Trasporta il traffico RDMA che le GPU scambiano durante le operazioni collettive, ed è separato dalla rete front-end usata per gestione e storage. In pratica un fabric GPU è una rete Ethernet leaf-spine (Clos), solitamente rail-optimized, che esegue RoCEv2 lossless. OcNOS-DC lo fornisce su hardware Broadcom Tomahawk 5.
Qual è la differenza tra scale-up e scale-out?
Lo scale-up è l'interconnessione a larghissima banda all'interno di un server GPU e del suo dominio strettamente accoppiato, per esempio NVLink all'interno di un rack NVL72, dove le GPU comunicano a velocità dell'ordine dei terabit come se fossero un unico grande acceleratore. Lo scale-out è la rete tra server e pod, il fabric GPU descritto in questa pagina, costruito a partire dai livelli rail, leaf, spine e Clos su Ethernet. Un collettivo usa prima lo scale-up all'interno del dominio, poi il fabric GPU scale-out trasporta il resto tra i server.
Quale topologia usa un fabric GPU?
Most GPU fabrics use a rail-optimized leaf-spine design: each of a GPU server's 8 NICs connects to its own dedicated rail leaf, so the dominant same-rail AllReduce traffic stays on one leaf. As the cluster grows past a single pod, the design extends to a 3-stage Clos with a super-spine tier. Su Tomahawk 5 radix-64, un fabric a 2 livelli raggiunge circa 2,048 GPUs at 1:1 non-blocking and a 3-stage Clos scales to 16,000+ GPUs. See the rail-optimized network and AI fabric topologies pages.
Un fabric GPU deve essere lossless?
Sì, sul piano GPU. Le GPU spostano i dati con RDMA su RoCEv2, che offre prestazioni scarse in caso di perdita di pacchetti, quindi il fabric GPU è progettato lossless con Priority Flow Control ed ECN, e mantenuto caricato in modo uniforme con il bilanciamento dinamico del carico. È questo comportamento no-drop a impedire che un collettivo si blocchi. OcNOS-DC fornisce PFC, ECN, ECN Dinamico e DLB su Broadcom Tomahawk 5 esattamente per questo.

Stai realizzando un fabric GPU? Dimensioniamo il piano insieme.

Indicaci il numero di GPU e il workload, e un ingegnere IP Infusion elaborerà con te i calcoli sulle porte, oppure inizia da un layout rail-optimized di prima approssimazione nell'AI Fabric Design Suite.