RDMA · RoCEv2 · Ethernet sin pérdidas

¿Qué es RDMA?

RDMA (Remote Direct Memory Access) permite que una máquina lea o escriba la memoria de otra máquina directamente por la red, evitando tanto las CPU como el sistema operativo. El adaptador de red mueve los bytes directamente entre la memoria de aplicación de ambos extremos, de modo que la latencia es muy baja y la sobrecarga de CPU es casi nula. Sobre Ethernet, RoCEv2 transporta RDMA para que pueda enrutarse, y como RDMA asume que no hay paquetes descartados corre sobre una fabric sin pérdidas.

Zero-copykernel bypass, de adaptador a adaptador
Near zerosobrecarga de CPU en la ruta de datos
UDP 4791encapsulación RoCEv2, enrutable
LosslessOcNOS-DC sobre Broadcom TH5
El mecanismo

Zero-copy, bypass de CPU, y por qué ese es el punto

Una transferencia de red normal copia los datos a través del kernel y se apoya en la CPU en ambos extremos. RDMA elimina ambos. El adaptador lee directamente de la memoria de aplicación en el emisor y escribe directamente en la memoria de aplicación en el receptor, sin que nada atraviese la CPU en la ruta de datos. Eso es lo que ofrece la combinación de muy baja latencia, muy alto rendimiento y casi ningún coste de CPU de RDMA, y es por lo que RDMA se convirtió en el estándar para la comunicación GPU a GPU.

  • Zero-copy: los bytes se mueven directamente entre la memoria de aplicación de ambos extremos, sin pasar nunca por búferes intermedios del kernel.
  • Kernel bypass: el adaptador de red, no el sistema operativo, dirige la transferencia, de modo que la CPU queda fuera de la ruta de datos.
  • Sobrecarga casi nula: la CPU queda libre para ejecutar la carga de trabajo en lugar de barajar paquetes, lo que es decisivo a escala de GPU.
RDMA sobre Ethernet

Cómo transporta RoCEv2 RDMA sobre Ethernet

RoCEv2 (RDMA over Converged Ethernet, versión 2) encapsula RDMA en UDP e IP, usando el puerto UDP de destino 4791, de modo que puede enrutarse a través de una fabric Ethernet de capa 3 estándar sin necesidad de una red aparte. La operación RDMA sigue corriendo de adaptador a adaptador con el mismo comportamiento zero-copy; RoCEv2 simplemente le da una ruta Ethernet enrutable. Eso es lo que permite que una fabric Ethernet multiproveedor sustituya a InfiniBand en los clústeres de GPU.

Transporte enrutable

RDMA circula dentro de UDP e IP en el puerto 4791, de modo que cruza un centro de datos enrutado estándar en lugar de necesitar una fabric dedicada.

Red sin descartes

RDMA asume que la red nunca descarta un paquete, así que corre sobre una fabric sin pérdidas con PFC y ECN manteniendo cada salto sin descartes.

La fabric de IA

Este transporte es el fundamento de una fabric de IA: the GPU-to-GPU network that carries every collective during training.

Por qué importa para IA

Por qué los colectivos de IA dependen de RDMA, y por qué la fabric debe ser sin pérdidas

El entrenamiento de IA ejecuta operaciones colectivas como AllReduce: tras cada paso, cada GPU intercambia gradientes con todas las demás GPU, y luego todas esperan a ese intercambio antes del siguiente paso. Los volúmenes de datos son grandes y el calendario es ajustado, así que RDMA mantiene cada intercambio rápido y fuera de la CPU. Como un único paquete perdido fuerza una recuperación que dispara la latencia de cola y puede estancar todo el colectivo, RDMA sobre Ethernet siempre corre sobre una fabric sin pérdidas.

  • Los colectivos bloquean cada GPU hasta que el intercambio se completa, de modo que una menor latencia acorta el paso que todo el clúster está esperando.
  • RDMA mantiene el intercambio fuera de la CPU y libre de copias, lo que multiplicado por millones de pasos es una palanca directa sobre el tiempo total de entrenamiento.
  • OcNOS-DC suministra la fabric sin descartes con PFC, ECN y balanceo de carga dinámico sobre Broadcom Tomahawk 5, manteniendo los flujos fuera de los enlaces calientes.
Preguntas frecuentes

Qué es RDMA, respondido

¿Qué es RDMA?
RDMA stands for Remote Direct Memory Access. It lets one machine read or write another machine's memory directly over the network, without involving either machine's CPU and without copying the data through the operating system kernel. The network adapter moves the bytes straight between application memory on both ends. The result is very low latency and very high throughput with almost no CPU overhead, which is why RDMA is the standard way GPUs exchange data during AI training.
¿Cómo transporta RoCEv2 RDMA sobre Ethernet?
RoCEv2 (RDMA over Converged Ethernet, versión 2) encapsula RDMA en UDP e IP, usando el puerto UDP de destino 4791, de modo que RDMA puede enrutarse a través de un centro de datos Ethernet de capa 3 estándar en lugar de necesitar una red aparte. La operación RDMA sigue corriendo de adaptador a adaptador con el mismo comportamiento zero-copy y de bypass de CPU; RoCEv2 solo le da una ruta Ethernet enrutable. Esto es lo que convierte a una fabric Ethernet multiproveedor en una alternativa viable a InfiniBand para los clústeres de GPU.
¿Por qué importan el zero-copy y el bypass de CPU para IA?
AI training runs collective operations such as AllReduce, where every GPU exchanges gradients with every other GPU after each step, moving enormous amounts of data on a tight schedule. If the CPU had to copy every message through the kernel, it would become the bottleneck and burn power doing it. RDMA removes the CPU and the copies from the data path, so a GPU's data lands in the peer GPU's memory with minimal latency, which shortens the exchange every GPU is waiting on.
¿Por qué necesita RDMA una fabric sin pérdidas?
RDMA fue diseñado asumiendo que la red no descarta paquetes. Cuando un paquete se pierde, la recuperación es costosa y dispara la latencia de cola, lo que puede estancar todo un colectivo de GPU. Así que RDMA sobre Ethernet corre sobre una fabric sin pérdidas: el Priority Flow Control y ECN mantienen la red sin descartes. OcNOS-DC aporta esa fabric con PFC, ECN y balanceo de carga dinámico sobre hardware Broadcom Tomahawk 5. Vea las páginas de Ethernet sin pérdidas y RoCEv2 para el detalle.

¿Diseñando una fabric RDMA? Construyámosla sin pérdidas

Díganos la carga de trabajo y la escala de GPU, y un ingeniero de IP Infusion recorrerá el diseño de RoCEv2 y de fabric sin pérdidas con usted sobre hardware abierto con OcNOS-DC.