RDMA · RoCEv2 · Ethernet lossless

Cos'è RDMA?

RDMA (Remote Direct Memory Access) consente a una macchina di leggere o scrivere direttamente la memoria di un'altra macchina sulla rete, bypassando sia le CPU sia il sistema operativo. L'adattatore di rete sposta i byte direttamente tra la memoria applicativa di entrambe le estremità, così la latenza è molto bassa e l'overhead di CPU è vicino allo zero. Su Ethernet, RoCEv2 trasporta RDMA così da poter essere instradato, e poiché RDMA presuppone nessun pacchetto scartato, gira su un fabric lossless.

Zero-copybypass del kernel, da adattatore ad adattatore
Near zeroOverhead di CPU sul percorso dati
UDP 4791Incapsulamento RoCEv2, instradabile
LosslessOcNOS-DC su Broadcom TH5
Il meccanismo

Zero-copy, bypass della CPU e perché è questo il punto

Un normale trasferimento di rete copia i dati attraverso il kernel e si appoggia sulla CPU a entrambe le estremità. RDMA elimina entrambi. L'adattatore legge direttamente dalla memoria applicativa sul mittente e scrive direttamente nella memoria applicativa sul ricevente, senza che nulla attraversi la CPU sul percorso dati. È questo a offrire la combinazione di RDMA fatta di latenza molto bassa, throughput molto elevato e costo di CPU quasi nullo, ed è il motivo per cui RDMA è diventato lo standard per la comunicazione GPU-a-GPU.

  • Zero-copy: i byte si spostano direttamente tra la memoria applicativa di entrambe le estremità, senza mai transitare per buffer intermedi del kernel.
  • Bypass del kernel: l'adattatore di rete, non il sistema operativo, guida il trasferimento, così la CPU è fuori dal percorso dati.
  • Overhead quasi nullo: la CPU è liberata per eseguire il workload anziché smistare pacchetti, il che è decisivo su scala GPU.
RDMA su Ethernet

Come RoCEv2 trasporta RDMA su Ethernet

RoCEv2 (RDMA over Converged Ethernet, versione 2) incapsula RDMA in UDP e IP, usando la porta UDP di destinazione 4791, così da poter essere instradato attraverso un fabric Ethernet Layer 3 standard senza bisogno di una rete separata. L'operazione RDMA gira comunque da adattatore ad adattatore con lo stesso comportamento zero-copy; RoCEv2 gli fornisce semplicemente un percorso Ethernet instradabile. È questo a permettere a un fabric Ethernet multi-vendor di sostituire InfiniBand sui cluster GPU.

Trasporto instradabile

RDMA viaggia all'interno di UDP e IP sulla porta 4791, così attraversa un data center instradato standard anziché richiedere un fabric dedicato.

Rete no-drop

RDMA presuppone che la rete non scarti mai un pacchetto, quindi gira su un fabric lossless con PFC ed ECN che mantengono no-drop ogni hop.

Il fabric IA

Questo trasporto è la base di un fabric AI: the GPU-to-GPU network that carries every collective during training.

Perché è importante per l'IA

Perché i collettivi IA dipendono da RDMA, e perché il fabric deve essere lossless

L'addestramento IA esegue operazioni collettive come AllReduce: dopo ogni passaggio, ogni GPU scambia i gradienti con ogni altra GPU, poi tutte attendono quello scambio prima del passaggio successivo. I volumi di dati sono grandi e la pianificazione è serrata, quindi RDMA mantiene ogni scambio veloce e fuori dalla CPU. Poiché un singolo pacchetto perso forza un recupero che fa impennare la tail latency e può bloccare l'intero collettivo, RDMA su Ethernet gira sempre su un fabric lossless.

  • I collettivi bloccano ogni GPU finché lo scambio non si completa, quindi una latenza più bassa accorcia il passaggio che l'intero cluster sta attendendo.
  • RDMA mantiene lo scambio fuori dalla CPU e privo di copie, il che, moltiplicato su milioni di passaggi, è una leva diretta sul tempo totale di addestramento.
  • OcNOS-DC fornisce il fabric no-drop con PFC, ECN e bilanciamento dinamico del carico su Broadcom Tomahawk 5, tenendo i flussi lontani dai collegamenti critici.
FAQ

FAQ: Cos'è RDMA

Cos'è RDMA?
RDMA stands for Remote Direct Memory Access. It lets one machine read or write another machine's memory directly over the network, without involving either machine's CPU and without copying the data through the operating system kernel. The network adapter moves the bytes straight between application memory on both ends. The result is very low latency and very high throughput with almost no CPU overhead, which is why RDMA is the standard way GPUs exchange data during AI training.
Come RoCEv2 trasporta RDMA su Ethernet?
RoCEv2 (RDMA over Converged Ethernet, versione 2) incapsula RDMA in UDP e IP, usando la porta UDP di destinazione 4791, così RDMA può essere instradato attraverso un data center Ethernet Layer 3 standard anziché richiedere una rete separata. L'operazione RDMA gira comunque da adattatore ad adattatore con lo stesso comportamento zero-copy e di bypass della CPU; RoCEv2 gli fornisce semplicemente un percorso Ethernet instradabile. È questo a rendere un fabric Ethernet multi-vendor una valida alternativa a InfiniBand per i cluster GPU.
Perché zero-copy e bypass della CPU sono importanti per l'IA?
AI training runs collective operations such as AllReduce, where every GPU exchanges gradients with every other GPU after each step, moving enormous amounts of data on a tight schedule. If the CPU had to copy every message through the kernel, it would become the bottleneck and burn power doing it. RDMA removes the CPU and the copies from the data path, so a GPU's data lands in the peer GPU's memory with minimal latency, which shortens the exchange every GPU is waiting on.
Perché RDMA ha bisogno di un fabric lossless?
RDMA è stato progettato presupponendo che la rete non scarti pacchetti. Quando un pacchetto viene perso, il recupero è costoso e fa impennare la tail latency, il che può bloccare un intero collettivo GPU. Perciò RDMA su Ethernet gira su un fabric lossless: il Priority Flow Control ed ECN mantengono la rete no-drop. OcNOS-DC fornisce quel fabric con PFC, ECN e bilanciamento dinamico del carico su hardware Broadcom Tomahawk 5. Consulta le pagine su Ethernet lossless e RoCEv2 per i dettagli.

Stai progettando un fabric RDMA? Costruiamolo lossless

Indicaci il workload e la scala GPU, e un ingegnere IP Infusion percorrerà con te il design RoCEv2 e del fabric lossless su hardware aperto con OcNOS-DC.