RDMA · RoCEv2 · Verlustfreies Ethernet

Was ist RDMA?

RDMA (Remote Direct Memory Access) ermöglicht es einer Maschine, den Speicher einer anderen Maschine direkt über das Netzwerk zu lesen oder zu schreiben, unter Umgehung beider CPUs und des Betriebssystems. Der Netzwerkadapter bewegt Bytes direkt zwischen dem Anwendungsspeicher an beiden Enden, sodass die Latenz sehr niedrig und der CPU-Overhead nahezu null ist. Über Ethernet transportiert RoCEv2 RDMA, sodass es geroutet werden kann, und da RDMA von keinen verworfenen Paketen ausgeht, läuft es auf einer verlustfreien Fabric.

Zero-copyKernel-Bypass, Adapter zu Adapter
Near zeroCPU-Overhead auf dem Datenpfad
UDP 4791RoCEv2-Kapselung, routbar
LosslessOcNOS-DC auf Broadcom TH5
Der Mechanismus

Zero-Copy, CPU-Bypass und warum genau das der Punkt ist

Eine normale Netzwerkübertragung kopiert Daten durch den Kernel und stützt sich an beiden Enden auf die CPU. RDMA beseitigt beides. Der Adapter liest direkt aus dem Anwendungsspeicher beim Sender und schreibt direkt in den Anwendungsspeicher beim Empfänger, wobei nichts auf dem Datenpfad die CPU durchläuft. Das liefert RDMAs Kombination aus sehr niedriger Latenz, sehr hohem Durchsatz und nahezu keinen CPU-Kosten, und deshalb wurde RDMA zum Standard für die GPU-zu-GPU-Kommunikation.

  • Zero-copy: Bytes bewegen sich direkt zwischen dem Anwendungsspeicher an beiden Enden, niemals über zwischengeschaltete Kernel-Puffer geleitet.
  • Kernel-Bypass: der Netzwerkadapter, nicht das Betriebssystem, steuert die Übertragung, sodass die CPU außerhalb des Datenpfads liegt.
  • Nahezu null Overhead: die CPU wird freigesetzt, um den Workload auszuführen, statt Pakete zu verschieben, was in GPU-Größenordnung entscheidend ist.
RDMA über Ethernet

Wie RoCEv2 RDMA über Ethernet transportiert

RoCEv2 (RDMA over Converged Ethernet, Version 2) kapselt RDMA in UDP und IP, unter Verwendung des Ziel-UDP-Ports 4791, sodass es über eine standardisierte Layer-3-Ethernet-Fabric geroutet werden kann, ohne dass ein separates Netzwerk erforderlich ist. Die RDMA-Operation läuft weiterhin Adapter zu Adapter mit demselben Zero-Copy-Verhalten; RoCEv2 gibt ihr einfach einen routbaren Ethernet-Pfad. Das ermöglicht es einer Multi-Vendor-Ethernet-Fabric, bei GPU-Clustern an die Stelle von InfiniBand zu treten.

Routbarer Transport

RDMA fährt eingebettet in UDP und IP auf Port 4791, sodass es ein standardisiert geroutetes Rechenzentrum durchquert, statt eine dedizierte Fabric zu benötigen.

No-Drop-Netzwerk

RDMA geht davon aus, dass das Netzwerk niemals ein Paket verwirft, daher läuft es auf einer verlustfreien Fabric , bei der PFC und ECN jeden Hop No-Drop halten.

Die KI-Fabric

Dieser Transport ist die Grundlage einer AI-Fabric: the GPU-to-GPU network that carries every collective during training.

Warum es für KI wichtig ist

Warum KI-Kollektive von RDMA abhängen und warum die Fabric verlustfrei sein muss

KI-Training führt kollektive Operationen wie AllReduce aus: nach jedem Schritt tauscht jede GPU Gradienten mit jeder anderen GPU aus, dann warten alle auf diesen Austausch vor dem nächsten Schritt. Die Datenmengen sind groß und der Zeitplan ist eng, daher hält RDMA jeden Austausch schnell und von der CPU fern. Da ein einzelnes verlorenes Paket eine Wiederherstellung erzwingt, welche die Tail-Latenz in die Höhe treibt und das gesamte Kollektiv ins Stocken bringen kann, läuft RDMA über Ethernet immer auf einer verlustfreien Fabric.

  • Kollektive blockieren jede GPU, bis der Austausch abgeschlossen ist, daher verkürzt niedrigere Latenz den Schritt , auf den der gesamte Cluster wartet.
  • RDMA hält den Austausch von der CPU fern und frei von Kopien, was multipliziert über Millionen von Schritten ein direkter Hebel für die gesamte Trainingszeit ist.
  • OcNOS-DC stellt die No-Drop-Fabric bereit mit PFC, ECN und dynamischem Load-Balancing auf Broadcom Tomahawk 5, wodurch Flows von überlasteten Links ferngehalten werden.
FAQ

Was ist RDMA, beantwortet

Was ist RDMA?
RDMA stands for Remote Direct Memory Access. It lets one machine read or write another machine's memory directly over the network, without involving either machine's CPU and without copying the data through the operating system kernel. The network adapter moves the bytes straight between application memory on both ends. The result is very low latency and very high throughput with almost no CPU overhead, which is why RDMA is the standard way GPUs exchange data during AI training.
Wie transportiert RoCEv2 RDMA über Ethernet?
RoCEv2 (RDMA over Converged Ethernet, Version 2) kapselt RDMA in UDP und IP, unter Verwendung des Ziel-UDP-Ports 4791, sodass RDMA über ein standardisiertes Layer-3-Ethernet-Rechenzentrum geroutet werden kann, statt ein separates Netzwerk zu benötigen. Die RDMA-Operation läuft weiterhin Adapter zu Adapter mit demselben Zero-Copy- und CPU-Bypass-Verhalten; RoCEv2 gibt ihr einfach einen routbaren Ethernet-Pfad. Das macht eine Multi-Vendor-Ethernet-Fabric zu einer praktikablen Alternative zu InfiniBand für GPU-Cluster.
Warum sind Zero-Copy und CPU-Bypass für KI wichtig?
AI training runs collective operations such as AllReduce, where every GPU exchanges gradients with every other GPU after each step, moving enormous amounts of data on a tight schedule. If the CPU had to copy every message through the kernel, it would become the bottleneck and burn power doing it. RDMA removes the CPU and the copies from the data path, so a GPU's data lands in the peer GPU's memory with minimal latency, which shortens the exchange every GPU is waiting on.
Warum benötigt RDMA eine verlustfreie Fabric?
RDMA wurde unter der Annahme konzipiert, dass das Netzwerk keine Pakete verwirft. Wenn ein Paket verloren geht, ist die Wiederherstellung teuer und treibt die Tail-Latenz in die Höhe, was ein ganzes GPU-Kollektiv ins Stocken bringen kann. Daher läuft RDMA über Ethernet auf einer verlustfreien Fabric: Priority Flow Control und ECN halten das Netzwerk No-Drop. OcNOS-DC stellt diese Fabric mit PFC, ECN und dynamischem Load-Balancing auf Broadcom Tomahawk 5-Hardware bereit. Siehe die Seiten zu verlustfreiem Ethernet und RoCEv2 für Details.

Entwerfen Sie eine RDMA-Fabric? Bauen wir sie verlustfrei auf

Nennen Sie uns den Workload und die GPU-Größenordnung, und ein IP Infusion-Ingenieur geht das RoCEv2- und Verlustfrei-Fabric-Design gemeinsam mit Ihnen auf offener Hardware mit OcNOS-DC durch.