RoCEv2: Ethernet sin pérdidas para fabrics de IA
RoCEv2 es cómo RDMA corre sobre Ethernet estándar: encapsula RDMA en UDP/IP y usa el puerto UDP de destino 4791, de modo que el tráfico colectivo de GPU es enrutable a través de una fabric leaf-spine normal. Necesita una fabric sin pérdidas construida a partir de PFC y ECN, con DCQCN como bucle de control de congestión, y OcNOS ofrece hoy ese conjunto completo de herramientas sobre hardware abierto 400G y 800G soportado.
Las mismas GPU sobre una fabric leaf-spine sin pérdidas
Un segmento compacto de rail: dos spines y dos leaves transportando RoCEv2 entre cuatro GPU. Las tramas de pausa PFC viajan salto a salto ante la congestión, mientras que ECN marca los flujos elefante para la reacción de DCQCN en el origen. RDMA se encapsula en UDP/IP en el puerto de destino 4791, de modo que el mismo tráfico es enrutable a través de una fabric Ethernet estándar.

La pérdida casi nula mantiene eficientes los colectivos de GPU
Los colectivos de GPU (all-reduce, all-gather, all-to-all) generan flujos elefante que saturan rutas de fabric únicas y exigen una pérdida casi nula para mantener eficientes los trabajos de entrenamiento. Si se descarta un único paquete en un enlace RoCEv2 400G, la NIC afectada retransmite toda la ventana de envío RDMA, medible en segundos de tiempo de GPU ociosa. RoCEv2 convierte una fabric leaf-spine en un transporte sin pérdidas para estas cargas de trabajo al encapsular RDMA en UDP/IP en el puerto de destino 4791, de modo que el mismo tráfico es enrutable a través de la capa 3.
| Parameter | RoCEv1Capa 2 | RoCEv2UDP/IP, enrutable |
|---|---|---|
| Encapsulation | RDMA transportado directamente sobre Ethernet (EtherType dedicado). | RDMA encapsulado en UDP/IP, usando el puerto UDP de destino 4791. |
| Capa de red | Solo capa 2; confinado a un único dominio de difusión. | Enrutable en capa 3 a través de una fabric leaf-spine estándar. |
| Entropía ECMP | Sin cabecera IP o UDP que aplicar hash; reparto de rutas limitado. | Puerto de origen UDP variado como identificador de flujo para repartir el tráfico entre rutas ECMP. |
| Requisito de sin pérdidas | Necesita una fabric sin pérdidas construida a partir de PFC y ECN. | Necesita una fabric sin pérdidas construida a partir de PFC y ECN, con DCQCN como bucle de control de congestión. |
| Alcance y escala | Dentro de un rack o una única subred. | Fabrics de centro de datos enrutadas; diseños de referencia para clústeres de 256 a 4.096 GPU. |
Los controles que mantienen la fabric sin pérdidas
Una fabric RoCEv2 se mantiene sin pérdidas mediante tres mecanismos cooperantes: el control de flujo por prioridad pausa la clase de tráfico correcta, ECN y DCQCN sostienen el rendimiento sin pérdidas, y el enrutamiento adaptativo mantiene los pocos flujos grandes fuera de los enlaces ascendentes congestionados.
Pausa por prioridad
802.1Qbb PFC pausa una única clase de tráfico salto a salto de modo que las colas que transportan RDMA nunca descartan. OcNOS lo empareja con un watchdog de bloqueo PFC que detecta una prioridad estancada y se autorrecupera antes de que se propague.
Marcado ECN y el bucle DCQCN
El ECN basado en WRED marca los paquetes a medida que las colas crecen, y DCQCN es el bucle de control de congestión que reacciona en el origen para sostener el rendimiento sin pérdidas. Valores por defecto ajustados para colectivos xCCL, con anulación paramétrica para pilas RDMA personalizadas.
Enrutamiento adaptativo por flowlet
El hash ECMP estático colisiona en los pocos flujos elefante grandes que producen los colectivos de IA. DLB reasigna flowlets ante la saturación local del enlace en ventanas de submilisegundos, eliminando las colisiones de hash estático que perjudican a las topologías simétricas.
RoCEv2 tal como lo ofrece OcNOS
Más allá de los controles sin pérdidas, OcNOS incluye la telemetría, los diseños de referencia y un camino de actualización limpio que convierten una configuración sin pérdidas en una fabric operable.
Estadísticas de cola por prioridad
Sensores de streaming gNMI para la profundidad de cola, los contadores de pausa PFC, los paquetes marcados por ECN y la detección de microrráfagas, exportados en un intervalo de muestreo de 10 segundos para observabilidad en toda la fabric.
Tejidos optimizados para rieles
Diseños de referencia para topologías de rail alineado y fabric programada, que cubren clústeres de 256 a 4.096 GPU sobre switches abiertos 400G y 800G disponibles en el mercado. Los diagnósticos por CLI verifican una configuración sin pérdidas conocida como buena de extremo a extremo.
Un camino limpio hacia Ultra Ethernet
Construya RoCEv2 sin pérdidas hoy y mantenga un camino abierto hacia Ultra Ethernet, que añade packet spray y RDMA multi-path a Ethernet estándar a medida que se lanzan las NIC UEC. Un solo NOS transporta ambos.
Una sola imagen de NOS sobre hardware abierto
El conjunto de herramientas RoCEv2 es parte de la licencia base de OcNOS-DC, no un conjunto de complementos de pago, y corre sin cambios sobre una elección de hardware multiproveedor.
- Elección de hardware abierto. Ejecute RoCEv2 sobre plataformas UfiSpace, Edgecore o Celestica con la misma imagen de NOS, de modo que la capa de fabric no acarrea ningún bloqueo de proveedor.
- Paridad de funciones desde el primer día. El balanceo de carga adaptativo, el ajuste de DCQCN y la telemetría nativa del ASIC son parte de la licencia base de OcNOS-DC, no complementos de pago.
- Diseños de referencia. Configuraciones de referencia para topologías populares de fabric de IA, con las configuraciones y los resultados de las pruebas publicados.
- Acceso de ingeniería. El nivel de soporte superior incluye diálogo directo con el equipo RoCEv2 de OcNOS durante la puesta en marcha de la fabric.
Ethernet estándar, rendimiento RDMA, hardware abierto
RoCEv2 permite que una fabric de IA reutilice las operaciones y el equipamiento Ethernet que ya ejecuta el resto del centro de datos, y OcNOS es el habilitador que lo hace sin pérdidas sobre switches abiertos.
Ethernet estándar, velocidad RDMA
RoCEv2 transporta RDMA sobre UDP/IP enrutable, de modo que los colectivos de GPU obtienen un movimiento de datos de baja latencia y bajo consumo de CPU sin una fabric aparte de propósito específico.
Elección de hardware abierto
La misma configuración sin pérdidas corre sobre switches UfiSpace, Edgecore y Celestica a 400G y 800G, manteniendo multiproveedor la capa de fabric.
OcNOS es el habilitador
PFC, ECN, DCQCN, DLB y la telemetría por prioridad se entregan como un solo NOS sobre switches abiertos, de modo que la fabric sin pérdidas completa es una construcción, no un proyecto de integración.
RoCEv2, respondido
¿Qué es RoCEv2?
¿Cuál es la diferencia entre RoCEv2 y RoCEv1?
¿Requiere RoCEv2 una red sin pérdidas?
¿Qué puerto UDP utiliza RoCEv2?
¿Cómo se compara RoCEv2 con InfiniBand?
Profundice. Llévelo consigo.
El datasheet del producto y descargas técnicas y breves que profundizan más que esta página.
Datasheet de OcNOS-DC
Especificación completa de OcNOS-DC: el conjunto de funciones EVPN-VXLAN y Ethernet for AI, los SKU de software, las plataformas de hardware compatibles y la guía de pedido de la solución.
Obtener el datasheetAI Fabric sin pérdidas de 800G con OcNOS
Fabric RoCEv2 sin bloqueo sobre spines Broadcom Tomahawk 4/5: niveles de SKU, plataformas validadas y arquitectura de despliegue.
Obtener el briefFabric DC EVPN-VXLAN
Fabric de centro de datos leaf-spine de nivel operador: IRB simétrico, rutas Type-2/Type-5 y gateway anycast distribuido.
Obtener el briefDatasheet de OcNOS-DC
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
AI Fabric sin pérdidas de 800G con OcNOS
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Fabric DC EVPN-VXLAN
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
¿Construyendo o escalando una fabric de IA? Obtenga una revisión específica de su carga de trabajo
Díganos la escala de GPU y el patrón colectivo, y un ingeniero de IP Infusion dimensionará los niveles de switches y ajustará la configuración sin pérdidas con usted, o empiece con un primer trazado leaf-spine en el AI Fabric Design Suite.
Diseñe toda la fabric de IA con OcNOS
Desde el caso de negocio hasta los cálculos de recuento de puertos, retome donde esté en la construcción.