UDP 4791 · PFC + ECN · DCQCN

RoCEv2: Ethernet sin pérdidas para fabrics de IA

RoCEv2 es cómo RDMA corre sobre Ethernet estándar: encapsula RDMA en UDP/IP y usa el puerto UDP de destino 4791, de modo que el tráfico colectivo de GPU es enrutable a través de una fabric leaf-spine normal. Necesita una fabric sin pérdidas construida a partir de PFC y ECN, con DCQCN como bucle de control de congestión, y OcNOS ofrece hoy ese conjunto completo de herramientas sobre hardware abierto 400G y 800G soportado.

UDP 4791Puerto de destino RoCEv2
hasta 800Gplataformas RoCEv2 abiertas
1 NOSOcNOS-DC sobre hardware abierto
256 a 4.096Diseños de referencia de GPU
La fabric sin pérdidas

Las mismas GPU sobre una fabric leaf-spine sin pérdidas

Un segmento compacto de rail: dos spines y dos leaves transportando RoCEv2 entre cuatro GPU. Las tramas de pausa PFC viajan salto a salto ante la congestión, mientras que ECN marca los flujos elefante para la reacción de DCQCN en el origen. RDMA se encapsula en UDP/IP en el puerto de destino 4791, de modo que el mismo tráfico es enrutable a través de una fabric Ethernet estándar.

Topología de fabric de IA RoCEv2: dos spines, dos leaves y cuatro GPU, con flechas de pausa PFC sobre tráfico RoCEv2 sin pérdidas
RoCEv2: fabric de IA de dos spines y dos leaves que transporta tráfico de GPU sin pérdidas con flujo de pausa PFC.
Por qué RoCEv2 es importante para las AI fabrics

La pérdida casi nula mantiene eficientes los colectivos de GPU

Los colectivos de GPU (all-reduce, all-gather, all-to-all) generan flujos elefante que saturan rutas de fabric únicas y exigen una pérdida casi nula para mantener eficientes los trabajos de entrenamiento. Si se descarta un único paquete en un enlace RoCEv2 400G, la NIC afectada retransmite toda la ventana de envío RDMA, medible en segundos de tiempo de GPU ociosa. RoCEv2 convierte una fabric leaf-spine en un transporte sin pérdidas para estas cargas de trabajo al encapsular RDMA en UDP/IP en el puerto de destino 4791, de modo que el mismo tráfico es enrutable a través de la capa 3.

Parameter RoCEv1Capa 2 RoCEv2UDP/IP, enrutable
EncapsulationRDMA transportado directamente sobre Ethernet (EtherType dedicado).RDMA encapsulado en UDP/IP, usando el puerto UDP de destino 4791.
Capa de redSolo capa 2; confinado a un único dominio de difusión.Enrutable en capa 3 a través de una fabric leaf-spine estándar.
Entropía ECMPSin cabecera IP o UDP que aplicar hash; reparto de rutas limitado.Puerto de origen UDP variado como identificador de flujo para repartir el tráfico entre rutas ECMP.
Requisito de sin pérdidasNecesita una fabric sin pérdidas construida a partir de PFC y ECN.Necesita una fabric sin pérdidas construida a partir de PFC y ECN, con DCQCN como bucle de control de congestión.
Alcance y escalaDentro de un rack o una única subred.Fabrics de centro de datos enrutadas; diseños de referencia para clústeres de 256 a 4.096 GPU.
Sin pérdidas por diseño

Los controles que mantienen la fabric sin pérdidas

Una fabric RoCEv2 se mantiene sin pérdidas mediante tres mecanismos cooperantes: el control de flujo por prioridad pausa la clase de tráfico correcta, ECN y DCQCN sostienen el rendimiento sin pérdidas, y el enrutamiento adaptativo mantiene los pocos flujos grandes fuera de los enlaces ascendentes congestionados.

Priority Flow Control

Pausa por prioridad

802.1Qbb PFC pausa una única clase de tráfico salto a salto de modo que las colas que transportan RDMA nunca descartan. OcNOS lo empareja con un watchdog de bloqueo PFC que detecta una prioridad estancada y se autorrecupera antes de que se propague.

Control de congestión

Marcado ECN y el bucle DCQCN

El ECN basado en WRED marca los paquetes a medida que las colas crecen, y DCQCN es el bucle de control de congestión que reacciona en el origen para sostener el rendimiento sin pérdidas. Valores por defecto ajustados para colectivos xCCL, con anulación paramétrica para pilas RDMA personalizadas.

Balanceo de carga

Enrutamiento adaptativo por flowlet

El hash ECMP estático colisiona en los pocos flujos elefante grandes que producen los colectivos de IA. DLB reasigna flowlets ante la saturación local del enlace en ventanas de submilisegundos, eliminando las colisiones de hash estático que perjudican a las topologías simétricas.

La implementación en OcNOS

RoCEv2 tal como lo ofrece OcNOS

Más allá de los controles sin pérdidas, OcNOS incluye la telemetría, los diseños de referencia y un camino de actualización limpio que convierten una configuración sin pérdidas en una fabric operable.

Telemetría

Estadísticas de cola por prioridad

Sensores de streaming gNMI para la profundidad de cola, los contadores de pausa PFC, los paquetes marcados por ECN y la detección de microrráfagas, exportados en un intervalo de muestreo de 10 segundos para observabilidad en toda la fabric.

Diseños de referencia

Tejidos optimizados para rieles

Diseños de referencia para topologías de rail alineado y fabric programada, que cubren clústeres de 256 a 4.096 GPU sobre switches abiertos 400G y 800G disponibles en el mercado. Los diagnósticos por CLI verifican una configuración sin pérdidas conocida como buena de extremo a extremo.

Transporte de nueva generación

Un camino limpio hacia Ultra Ethernet

Construya RoCEv2 sin pérdidas hoy y mantenga un camino abierto hacia Ultra Ethernet, que añade packet spray y RDMA multi-path a Ethernet estándar a medida que se lanzan las NIC UEC. Un solo NOS transporta ambos.

Why OcNOS

Una sola imagen de NOS sobre hardware abierto

El conjunto de herramientas RoCEv2 es parte de la licencia base de OcNOS-DC, no un conjunto de complementos de pago, y corre sin cambios sobre una elección de hardware multiproveedor.

  • Elección de hardware abierto. Ejecute RoCEv2 sobre plataformas UfiSpace, Edgecore o Celestica con la misma imagen de NOS, de modo que la capa de fabric no acarrea ningún bloqueo de proveedor.
  • Paridad de funciones desde el primer día. El balanceo de carga adaptativo, el ajuste de DCQCN y la telemetría nativa del ASIC son parte de la licencia base de OcNOS-DC, no complementos de pago.
  • Diseños de referencia. Configuraciones de referencia para topologías populares de fabric de IA, con las configuraciones y los resultados de las pruebas publicados.
  • Acceso de ingeniería. El nivel de soporte superior incluye diálogo directo con el equipo RoCEv2 de OcNOS durante la puesta en marcha de la fabric.
La perspectiva de IP Infusion

Ethernet estándar, rendimiento RDMA, hardware abierto

RoCEv2 permite que una fabric de IA reutilice las operaciones y el equipamiento Ethernet que ya ejecuta el resto del centro de datos, y OcNOS es el habilitador que lo hace sin pérdidas sobre switches abiertos.

Ethernet estándar, velocidad RDMA

RoCEv2 transporta RDMA sobre UDP/IP enrutable, de modo que los colectivos de GPU obtienen un movimiento de datos de baja latencia y bajo consumo de CPU sin una fabric aparte de propósito específico.

Elección de hardware abierto

La misma configuración sin pérdidas corre sobre switches UfiSpace, Edgecore y Celestica a 400G y 800G, manteniendo multiproveedor la capa de fabric.

OcNOS es el habilitador

PFC, ECN, DCQCN, DLB y la telemetría por prioridad se entregan como un solo NOS sobre switches abiertos, de modo que la fabric sin pérdidas completa es una construcción, no un proyecto de integración.

Preguntas frecuentes

RoCEv2, respondido

¿Qué es RoCEv2?
RoCEv2 (RDMA over Converged Ethernet version 2) transporta el tráfico RDMA sobre redes UDP/IP enrutables, lo que permite a los servidores mover datos directamente de memoria a memoria con una latencia muy baja y una escasa carga de CPU. Se utiliza ampliamente en clústeres de IA y almacenamiento de alta velocidad sobre fabrics Ethernet.
¿Cuál es la diferencia entre RoCEv2 y RoCEv1?
RoCEv2 ejecuta RDMA sobre UDP/IP, por lo que es enrutable a través de redes Layer 3, mientras que RoCEv1 se ejecuta directamente sobre Ethernet (Layer 2) y permanece dentro de un único dominio de broadcast. RoCEv2 escala hacia fabric de data center enrutadas y de mayor tamaño que RoCEv1 no puede alcanzar.
¿Requiere RoCEv2 una red sin pérdidas?
RoCEv2 necesita un fabric sin pérdidas o casi sin pérdidas, ya que el rendimiento de RDMA cae de forma pronunciada cuando se pierden paquetes. Los operadores lo consiguen con PFC para el control de flujo y ECN con DCQCN para el control de congestión, manteniendo las colas poco profundas para que los flujos RDMA eviten descartes y retransmisiones.
¿Qué puerto UDP utiliza RoCEv2?
RoCEv2 utiliza el puerto UDP de destino 4791, el puerto reservado por la IANA para el tráfico RoCEv2. Dado que RDMA se encapsula en UDP/IP, los paquetes son enrutables y el puerto de origen UDP puede variarse como identificador de flujo para repartir el tráfico entre las rutas ECMP.
¿Cómo se compara RoCEv2 con InfiniBand?
RoCEv2 ofrece RDMA sobre Ethernet e IP estándar, mientras que InfiniBand es una fabric independiente y de propósito específico, con sus propios conmutadores y adaptadores. RoCEv2 reutiliza las operaciones y el equipamiento Ethernet, motivo por el cual numerosas redes de IA y de almacenamiento la adoptan en lugar de una fabric InfiniBand dedicada.

¿Construyendo o escalando una fabric de IA? Obtenga una revisión específica de su carga de trabajo

Díganos la escala de GPU y el patrón colectivo, y un ingeniero de IP Infusion dimensionará los niveles de switches y ajustará la configuración sin pérdidas con usted, o empiece con un primer trazado leaf-spine en el AI Fabric Design Suite.