Was ist RDMA?
RDMA (Remote Direct Memory Access) ermöglicht es einer Maschine, den Speicher einer anderen Maschine direkt über das Netzwerk zu lesen oder zu schreiben, unter Umgehung beider CPUs und des Betriebssystems. Der Netzwerkadapter bewegt Bytes direkt zwischen dem Anwendungsspeicher an beiden Enden, sodass die Latenz sehr niedrig und der CPU-Overhead nahezu null ist. Über Ethernet transportiert RoCEv2 RDMA, sodass es geroutet werden kann, und da RDMA von keinen verworfenen Paketen ausgeht, läuft es auf einer verlustfreien Fabric.
Zero-Copy, CPU-Bypass und warum genau das der Punkt ist
Eine normale Netzwerkübertragung kopiert Daten durch den Kernel und stützt sich an beiden Enden auf die CPU. RDMA beseitigt beides. Der Adapter liest direkt aus dem Anwendungsspeicher beim Sender und schreibt direkt in den Anwendungsspeicher beim Empfänger, wobei nichts auf dem Datenpfad die CPU durchläuft. Das liefert RDMAs Kombination aus sehr niedriger Latenz, sehr hohem Durchsatz und nahezu keinen CPU-Kosten, und deshalb wurde RDMA zum Standard für die GPU-zu-GPU-Kommunikation.
- Zero-copy: Bytes bewegen sich direkt zwischen dem Anwendungsspeicher an beiden Enden, niemals über zwischengeschaltete Kernel-Puffer geleitet.
- Kernel-Bypass: der Netzwerkadapter, nicht das Betriebssystem, steuert die Übertragung, sodass die CPU außerhalb des Datenpfads liegt.
- Nahezu null Overhead: die CPU wird freigesetzt, um den Workload auszuführen, statt Pakete zu verschieben, was in GPU-Größenordnung entscheidend ist.
Wie RoCEv2 RDMA über Ethernet transportiert
RoCEv2 (RDMA over Converged Ethernet, Version 2) kapselt RDMA in UDP und IP, unter Verwendung des Ziel-UDP-Ports 4791, sodass es über eine standardisierte Layer-3-Ethernet-Fabric geroutet werden kann, ohne dass ein separates Netzwerk erforderlich ist. Die RDMA-Operation läuft weiterhin Adapter zu Adapter mit demselben Zero-Copy-Verhalten; RoCEv2 gibt ihr einfach einen routbaren Ethernet-Pfad. Das ermöglicht es einer Multi-Vendor-Ethernet-Fabric, bei GPU-Clustern an die Stelle von InfiniBand zu treten.
Routbarer Transport
RDMA fährt eingebettet in UDP und IP auf Port 4791, sodass es ein standardisiert geroutetes Rechenzentrum durchquert, statt eine dedizierte Fabric zu benötigen.
No-Drop-Netzwerk
RDMA geht davon aus, dass das Netzwerk niemals ein Paket verwirft, daher läuft es auf einer verlustfreien Fabric , bei der PFC und ECN jeden Hop No-Drop halten.
Die KI-Fabric
Dieser Transport ist die Grundlage einer AI-Fabric: the GPU-to-GPU network that carries every collective during training.
Warum KI-Kollektive von RDMA abhängen und warum die Fabric verlustfrei sein muss
KI-Training führt kollektive Operationen wie AllReduce aus: nach jedem Schritt tauscht jede GPU Gradienten mit jeder anderen GPU aus, dann warten alle auf diesen Austausch vor dem nächsten Schritt. Die Datenmengen sind groß und der Zeitplan ist eng, daher hält RDMA jeden Austausch schnell und von der CPU fern. Da ein einzelnes verlorenes Paket eine Wiederherstellung erzwingt, welche die Tail-Latenz in die Höhe treibt und das gesamte Kollektiv ins Stocken bringen kann, läuft RDMA über Ethernet immer auf einer verlustfreien Fabric.
- Kollektive blockieren jede GPU, bis der Austausch abgeschlossen ist, daher verkürzt niedrigere Latenz den Schritt , auf den der gesamte Cluster wartet.
- RDMA hält den Austausch von der CPU fern und frei von Kopien, was multipliziert über Millionen von Schritten ein direkter Hebel für die gesamte Trainingszeit ist.
- OcNOS-DC stellt die No-Drop-Fabric bereit mit PFC, ECN und dynamischem Load-Balancing auf Broadcom Tomahawk 5, wodurch Flows von überlasteten Links ferngehalten werden.
Was ist RDMA, beantwortet
Was ist RDMA?
Wie transportiert RoCEv2 RDMA über Ethernet?
Warum sind Zero-Copy und CPU-Bypass für KI wichtig?
Warum benötigt RDMA eine verlustfreie Fabric?
Entwerfen Sie eine RDMA-Fabric? Bauen wir sie verlustfrei auf
Nennen Sie uns den Workload und die GPU-Größenordnung, und ein IP Infusion-Ingenieur geht das RoCEv2- und Verlustfrei-Fabric-Design gemeinsam mit Ihnen auf offener Hardware mit OcNOS-DC durch.
Die gesamte KI-Fabric mit OcNOS entwerfen
Vom Business Case bis zur Portanzahl-Berechnung: Steigen Sie dort ein, wo Sie beim Aufbau gerade stehen.
Gehen Sie tiefer. Nehmen Sie es mit.
Zwei kurze, technische Downloads, die weiter gehen als diese Seite: das vollständige OcNOS-DC-Datenblatt und die verlustfreie 800G-KI-Fabric-Architektur.
OcNOS-DC Datenblatt
Vollständige OcNOS-DC Spezifikation: Funktionsumfang für EVPN-VXLAN und Ethernet for AI, Software-SKUs, unterstützte Hardware-Plattformen und der Solution Ordering Guide.
Datasheet abrufenOcNOS 800G verlustfreie AI Fabric
Non-blocking RoCEv2-Fabric auf Broadcom Tomahawk 4/5 Spines: SKU-Stufen, validierte Plattformen und Deployment-Architektur.
Brief anfordernOcNOS-DC Datenblatt
Kurzes Formular. Ihr PDF öffnet sich unmittelbar nach dem Absenden in einem neuen Tab.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.
OcNOS 800G verlustfreie AI Fabric
Kurzes Formular. Ihr PDF öffnet sich unmittelbar nach dem Absenden in einem neuen Tab.
✓ Ihr PDF wird in einem neuen Tab geöffnet…
Falls es sich nicht geöffnet hat, nutzen Sie den untenstehenden Link.