RDMA · RoCEv2 · Ethernet sans perte

Qu'est-ce que RDMA ?

RDMA (Remote Direct Memory Access) permet à une machine de lire ou d'écrire directement la mémoire d'une autre machine sur le réseau, en contournant à la fois les CPU et le système d'exploitation. L'adaptateur réseau déplace les octets directement entre la mémoire applicative des deux extrémités, de sorte que la latence est très faible et la charge CPU quasi nulle. Sur Ethernet, RoCEv2 transporte le RDMA pour qu'il puisse être routé, et comme RDMA suppose qu'aucun paquet n'est perdu, il fonctionne sur un fabric sans perte.

Zero-copycontournement du noyau, d'adaptateur à adaptateur
Near zerocharge CPU sur le chemin de données
UDP 4791encapsulation RoCEv2, routable
LosslessOcNOS-DC sur Broadcom TH5
Le mécanisme

Zéro copie, contournement du CPU, et pourquoi c'est l'essentiel

Un transfert réseau normal copie les données à travers le noyau et sollicite le CPU aux deux extrémités. RDMA supprime les deux. L'adaptateur lit directement dans la mémoire applicative de l'émetteur et écrit directement dans la mémoire applicative du récepteur, sans que rien ne traverse le CPU sur le chemin de données. C'est ce qui procure à RDMA sa combinaison de très faible latence, de très haut débit et de coût CPU quasi nul, et c'est pourquoi RDMA est devenu la norme pour la communication GPU-à-GPU.

  • Zero-copy: les octets se déplacent directement entre la mémoire applicative des deux extrémités, sans jamais transiter par des buffers intermédiaires du noyau.
  • Contournement du noyau : c'est l'adaptateur réseau, et non le système d'exploitation, qui pilote le transfert, de sorte que le CPU est hors du chemin de données.
  • Charge quasi nulle : le CPU est libéré pour exécuter la charge de travail plutôt que de brasser des paquets, ce qui est décisif à l'échelle GPU.
RDMA sur Ethernet

Comment RoCEv2 transporte le RDMA sur Ethernet

RoCEv2 (RDMA over Converged Ethernet, version 2) encapsule le RDMA dans UDP et IP, en utilisant le port UDP de destination 4791, afin qu'il puisse être routé à travers un fabric Ethernet Layer 3 standard sans réseau distinct requis. L'opération RDMA s'exécute toujours d'adaptateur à adaptateur avec le même comportement zéro copie ; RoCEv2 lui donne simplement un chemin Ethernet routable. C'est ce qui permet à un fabric Ethernet multi-fournisseurs de remplacer InfiniBand sur les clusters GPU.

Transport routable

RDMA circule dans UDP et IP sur le port 4791, de sorte qu'il traverse un data center routé standard au lieu de nécessiter un fabric dédié.

Réseau sans perte

RDMA suppose que le réseau ne perd jamais de paquet, il fonctionne donc sur un fabric sans perte avec PFC et ECN qui maintiennent chaque saut sans perte.

Le fabric IA

Ce transport est le fondement d'un fabric IA: the GPU-to-GPU network that carries every collective during training.

Pourquoi c'est important pour l'IA

Pourquoi les collectifs IA dépendent de RDMA, et pourquoi le fabric doit être sans perte

L'entraînement IA exécute des opérations collectives telles qu'AllReduce : après chaque étape, chaque GPU échange des gradients avec tous les autres GPU, puis tous attendent cet échange avant l'étape suivante. Les volumes de données sont importants et le calendrier est serré, RDMA maintient donc chaque échange rapide et hors du CPU. Comme un seul paquet perdu force une reprise qui fait grimper la latence de queue et peut bloquer tout le collectif, le RDMA sur Ethernet fonctionne toujours sur un fabric sans perte.

  • Les collectifs bloquent chaque GPU jusqu'à ce que l'échange s'achève, de sorte que une latence plus faible raccourcit l'étape que l'ensemble du cluster attend.
  • RDMA maintient l'échange hors du CPU et sans copies, ce qui, multiplié sur des millions d'étapes, constitue un levier direct sur le temps total d'entraînement.
  • OcNOS-DC fournit le fabric sans perte avec PFC, ECN et équilibrage de charge dynamique sur Broadcom Tomahawk 5, en éloignant les flux des liens saturés.
FAQ

Qu'est-ce que RDMA, la réponse

Qu'est-ce que RDMA ?
RDMA stands for Remote Direct Memory Access. It lets one machine read or write another machine's memory directly over the network, without involving either machine's CPU and without copying the data through the operating system kernel. The network adapter moves the bytes straight between application memory on both ends. The result is very low latency and very high throughput with almost no CPU overhead, which is why RDMA is the standard way GPUs exchange data during AI training.
Comment RoCEv2 transporte-t-il le RDMA sur Ethernet ?
RoCEv2 (RDMA over Converged Ethernet, version 2) encapsule le RDMA dans UDP et IP, en utilisant le port UDP de destination 4791, afin que le RDMA puisse être routé à travers un data center Ethernet Layer 3 standard au lieu de nécessiter un réseau distinct. L'opération RDMA s'exécute toujours d'adaptateur à adaptateur avec le même comportement zéro copie et de contournement du CPU ; RoCEv2 lui donne simplement un chemin Ethernet routable. C'est ce qui fait d'un fabric Ethernet multi-fournisseurs une alternative viable à InfiniBand pour les clusters GPU.
Pourquoi le zéro copie et le contournement du CPU sont-ils importants pour l'IA ?
AI training runs collective operations such as AllReduce, where every GPU exchanges gradients with every other GPU after each step, moving enormous amounts of data on a tight schedule. If the CPU had to copy every message through the kernel, it would become the bottleneck and burn power doing it. RDMA removes the CPU and the copies from the data path, so a GPU's data lands in the peer GPU's memory with minimal latency, which shortens the exchange every GPU is waiting on.
Pourquoi RDMA a-t-il besoin d'un fabric sans perte ?
RDMA a été conçu en supposant que le réseau ne perd pas de paquets. Lorsqu'un paquet est perdu, la reprise est coûteuse et fait grimper la latence de queue, ce qui peut bloquer tout un collectif GPU. Le RDMA sur Ethernet fonctionne donc sur un fabric sans perte : le Priority Flow Control et l'ECN maintiennent le réseau sans perte. OcNOS-DC fournit ce fabric avec PFC, ECN et l'équilibrage de charge dynamique sur du matériel Broadcom Tomahawk 5. Consultez les pages sur l'Ethernet sans perte et RoCEv2 pour le détail.

Vous concevez un fabric RDMA ? Construisons-le sans perte

Indiquez-nous la charge de travail et l'échelle GPU, et un ingénieur IP Infusion parcourra avec vous la conception RoCEv2 et du fabric sans perte sur du matériel ouvert exécutant OcNOS-DC.