RoCEv2 · PFC / ECN · DCQCN

RoCE frente a InfiniBand para clústeres de IA

RoCEv2 ejecuta RDMA sobre Ethernet abierto y multiproveedor; InfiniBand es una fabric sin pérdidas de un solo proveedor. RoCEv2 se mantiene sin pérdidas con PFC y ECN y controla la congestión con DCQCN, mientras que InfiniBand es sin pérdidas por diseño mediante control de flujo basado en créditos. Para la mayoría de las cargas de trabajo de IA, Ethernet con RoCEv2 ya iguala a InfiniBand manteniendo la elección de hardware. Esta página los compara eje por eje.

UDP 4791RDMA enrutable en capa 3
hasta 800Gfabrics RoCEv2 abiertas
1 contractOcNOS-DC + hardware validado
600+redes de operador sobre OcNOS
Dos fabrics, dos formas de mantenerse sin pérdidas

Las mismas GPU, dos formas de mantenerse sin pérdidas

Izquierda: RoCEv2 sobre Ethernet mantiene las colas poco profundas con pausa PFC salto a salto, marcado ECN en el switch y control de tasa DCQCN de vuelta en la NIC emisora. Derecha: InfiniBand usa control de flujo basado en créditos, enviando solo cuando el receptor ha anunciado créditos de búfer. Ambas evitan descartes; una sobre Ethernet abierto y multiproveedor, la otra sobre una fabric de un solo proveedor.

RoCEv2 PFC/ECN/DCQCN loop versus InfiniBand credit-based flow control Two side-by-side diagrams. Left: a sending GPU NIC and a receiving GPU NIC connected through an Ethernet switch running OcNOS-DC. PFC pause acts hop-by-hop, the switch marks ECN on congestion, and a DCQCN signal returns to the sending NIC to lower its rate. Right: an InfiniBand switch and adapter exchanging buffer credits, so a sender transmits only when the receiver has advertised credit. Bottom band contrasts open multi-vendor Ethernet with a single-vendor InfiniBand fabric. RoCEv2 · OPEN ETHERNET INFINIBAND · SINGLE-VENDOR GPU NICsender SwitchOcNOS-DC · TH5 GPU NICreceiver ECN mark PFC pause (hop-by-hop) DCQCN rate control to sender PFC + ECN keep the fabric lossless · DCQCN controls congestion IB Switchsubnet manager GPU HCAIB adapter data (only if credits > 0) buffer credits Credit-based flow control · lossless by design · single ecosystem OPEN MULTI-VENDOR ETHERNET vs SINGLE-VENDOR INFINIBAND FABRIC
Cómo se comparan

RoCE e InfiniBand, eje por eje

RoCE es RDMA sobre Ethernet Convergente; la versión que importa para IA es RoCEv2, que encapsula RDMA en UDP/IP en el puerto de destino 4791 de modo que el tráfico es enrutable a través de una fabric Ethernet de capa 3. InfiniBand es una interconexión de propósito específico de la InfiniBand Trade Association, sin pérdidas por arquitectura mediante control de flujo basado en créditos. La pregunta práctica para un clúster de IA es qué transporte satisface la carga de trabajo manteniendo cuerdos el coste, la cadena de suministro y las operaciones.

Axis RoCERoCEv2 sobre Ethernet, abierto InfiniBandfabric de un solo proveedor
Transport & standardRDMA sobre UDP/IP (RoCEv2, IBTA), enrutable en capa 3 en el puerto UDP de destino 4791. Circula sobre Ethernet IEEE estándar.Capas de enlace y transporte InfiniBand de propósito específico (IBTA), con switches dedicados y adaptadores de canal de host.
Cómo se mantiene sin pérdidasPFC para el control de flujo salto a salto más ECN con DCQCN para el control de congestión extremo a extremo, manteniendo poco profundas las colas del switch de modo que RDMA evita descartes.Control de flujo basado en créditos: un emisor transmite solo contra los créditos de búfer anunciados por el receptor, de modo que la fabric es sin pérdidas por diseño.
EcosistemaAbierto y multiproveedor en cada capa: ASIC de switch, switch, NIC, NOS y óptica de proveedores independientes.De facto de un solo proveedor para el silicio de NIC y de switch; la fabric, los adaptadores y la gestión vienen como una sola pila.
Elección de silicio de switchBroadcom Tomahawk 5 (51.2 Tbps, 64x800G) y Tomahawk 4 (25.6 Tbps, 64x400G) en plataformas Edgecore y UfiSpace, entre otras.Silicio solo del proveedor de InfiniBand; sin suministro independiente de ASIC o switch.
Control de congestiónDCQCN extremo a extremo: el switch marca ECN y la NIC emisora baja su tasa. El balanceo de carga adaptativo (DLB) reparte los flujos y reequilibra ante la congestión local.Control de flujo basado en créditos con enrutamiento adaptativo incorporado en la especificación.
ScaleOn Tomahawk 5, a 2-tier fabric reaches roughly 2,048 GPUs at 1:1 (toward 8,000+ with 800G breakout); a 3-stage Clos extends to 16,000+ and up to about 65,536 endpoints.Escala mediante topologías de fat-tree gestionadas por un subnet manager centralizado dentro de la fabric de un proveedor.
Operations & toolingOperaciones Ethernet estándar: BGP, EVPN, telemetría gNMI/OpenConfig y la misma automatización (Ansible, NETCONF) usada en todo el centro de datos.Herramientas InfiniBand especializadas y un subnet manager, separados del resto del modelo operativo del centro de datos.
Bloqueo de proveedorNinguno inherente: combine hardware y software a voluntad, y consiga una segunda fuente en la cadena de suministro.Alto: NIC, switch, cableado y gestión suelen venir de un solo proveedor.
Cost trendLos spines de hardware abierto con OcNOS-DC a 400G y 800G socavan sustancialmente las fabrics de un solo proveedor, y la brecha se amplía a medida que suben las velocidades de puerto.Los precios de un solo proveedor aplican un sobreprecio a igualdad de capacidad.

InfiniBand es una marca registrada de la InfiniBand Trade Association. NVIDIA y Mellanox son marcas registradas de sus respectivos propietarios. Esta comparación se ofrece con fines informativos y no implica afiliación ni respaldo.

La decisión

Dónde gana cada uno

La respuesta correcta es específica de cada carga de trabajo. Elija InfiniBand donde un piso de latencia absoluto sea el requisito; elija RoCE donde el modelo operativo, el coste o el alcance entre sitios decida.

InfiniBand encaja cuando

El piso de latencia es la especificación

Simulación HPC estrechamente acoplada donde el piso de latencia absoluto NIC a NIC importa más que el coste total de propiedad, y clústeres cautivos monotenant donde una pila de un solo proveedor es aceptable.

RoCE encaja cuando

Las operaciones y la cadena de suministro importan

GPU-as-a-Service multitenant y back-ends de IA que comparten un modelo operativo, una pila de herramientas y una cadena de suministro multiproveedor con el resto del centro de datos.

RoCE encaja cuando

El coste por GPU es la barrera

Los spines de hardware abierto más OcNOS-DC eliminan el sobreprecio de red de un solo proveedor. En una construcción de varios miles de GPU, eso supone una porción sustancial del presupuesto de hardware.

RoCE encaja cuando

La fabric abarca centros de datos

Ethernet se extiende de forma natural entre salas y regiones con óptica coherente 400G ZR/ZR+, sin una capa de gateway de larga distancia aparte.

El camino abierto

Cómo ofrece OcNOS-DC el camino RoCEv2

OcNOS-DC aporta el sustrato Ethernet sin pérdidas que RoCEv2 requiere. El switch suministra las primitivas de evitación de pérdidas y de congestión; RoCEv2 es el transporte que corre en la NIC. Estas son capacidades de switch verificadas en OcNOS-DC hoy.

Losslessness

PFC and ECN

Priority Flow Control, incluido PFC-con-QoS sobre capa 3 con DCBX/LLDP, más ECN y Dynamic ECN de modo que los flujos RDMA mantienen colas poco profundas sin descartes.

Congestion

Marcado DCQCN

El switch marca ECN de modo que el bucle DCQCN extremo a extremo bucle DCQCN de NIC-más-switch pueda limitar la tasa de los emisores. ETS y WRED conforman y gestionan las colas que transportan RDMA.

Balanceo de carga

DLB y RTAG7

Balanceo de carga dinámico (incluidos Reactive Path Rebalance y Random Flow) con hash RTAG7 reparte los colectivos y reequilibra ante la congestión local.

Resilience

Protección de deadlock PFC

PFC Deadlock Detection and Recovery más el ajuste de búfer mantienen estable la fabric sin pérdidas bajo la propagación de pausa que PFC puede crear.

Telemetría

gNMI / OpenConfig

Streaming telemetría gNMI y OpenConfig da visibilidad por prioridad para el ajuste en bucle cerrado durante la puesta en marcha del clúster y la operación en régimen estacionario.

UEC-ready

Alineado con UEC 1.0

IP Infusion es miembro contribuyente del Ultra Ethernet Consortium, y OcNOS-DC se alinea con el Perfil de tejido UEC 1.0, de modo que la fabric se mantiene a futuro a medida que se lanzan las NIC compatibles con UEC. La alineación no es una declaración de certificación.

La elección de silicio es abierta: OcNOS-DC corre sobre el Edgecore AIS800-64D y el UfiSpace S9321-64E / S9321-64EO (el -64EO añade 400G ZR+) sobre Broadcom Tomahawk 5, y el Edgecore AS9736-64D sobre Tomahawk 4, todas plataformas on-chip y de búfer compartido ajustadas para RoCEv2. Un solo contrato de IP Infusion cubre el software y el hardware validado, con un solo TAC y un solo SLA.

Por qué el cambio

Por qué muchos operadores pasan a Ethernet para los back-ends de IA

El cambio es operativo y económico más que una cuestión de latencia bruta. Tres cosas suman rápido en una construcción grande: un solo modelo de red compartido con el resto del centro de datos, una cadena de suministro multiproveedor y un menor coste por puerto a 400G y 800G.

La escala está probada en el campo. Meta ha descrito el entrenamiento de sus modelos más grandes sobre una fabric Ethernet RoCE en un clúster de 24.000 GPU, un tamaño que alguna vez se supuso que requería InfiniBand. El balanceo de carga adaptativo en Tomahawk 4 y Tomahawk 5 reasigna flujos ante la congestión en tiempo real, de modo que una fabric bien gestionada puede apuntar a una utilización superior al 90 por ciento donde el hash estático la dejaría varada. El noventa por ciento es un objetivo de diseño, no una garantía medida.

La ventaja que le queda a InfiniBand, un piso de latencia absoluto menor, sigue importando para un conjunto de cargas de trabajo HPC estrechamente acopladas. Para la mayoría de los colectivos de entrenamiento distribuido e inferencia a escala, una fabric RoCEv2 correctamente ajustada se sitúa por debajo del umbral que cambia el tiempo de finalización del trabajo, por lo que el argumento operativo y económico decide ahora la mayoría de las nuevas construcciones de back-end de IA.

  • Un solo modelo de red compartido con el resto del centro de datos, de modo que las habilidades y las herramientas se trasladan.
  • Una cadena de suministro multiproveedor que le permite conseguir una segunda fuente de silicio, switches, NIC y óptica.
  • Menor coste por puerto a 400G y 800G, liberando capital para más GPU, un nivel de almacenamiento mayor o un segundo sitio.
La versión corta

Ambos son válidos, y la mayoría de los nuevos back-ends de IA aterrizan en Ethernet

InfiniBand mantiene un piso de latencia absoluto menor que un conjunto de cargas de trabajo HPC estrechamente acopladas seguirá pagando. Para la mayoría de las construcciones de back-end de IA, el argumento operativo y económico decide a favor de RoCEv2 sobre Ethernet abierto.

Ambos son válidos

InfiniBand mantiene un piso de latencia absoluto menor que un conjunto de cargas de trabajo HPC estrechamente acopladas seguirá pagando.

RoCEv2 ha cerrado la brecha para IA

Con PFC, ECN, DCQCN y el balanceo de carga adaptativo configurados correctamente, Ethernet iguala a InfiniBand en la mayoría de los colectivos de entrenamiento distribuido manteniendo la elección de hardware.

La decisión suele ser operativa

Un solo modelo de red, una cadena de suministro multiproveedor y un menor coste por puerto a 400G y 800G deciden la mayoría de las nuevas construcciones de back-end de IA.

OcNOS-DC es el camino abierto

Primitivas RoCEv2 verificadas hoy, alineadas con UEC 1.0 para el mañana, sobre hardware abierto validado de Edgecore y UfiSpace, bajo un solo contrato, un solo TAC y un solo SLA.

Recurso

Obtenga el AI Fabric Reference Design

The full PDF: lossless RoCEv2 topology, switch and transceiver counts, validated platforms, and a DCQCN starting profile on OcNOS-DC.

Descargar PDF
Preguntas frecuentes

Preguntas frecuentes sobre RoCE frente a InfiniBand

¿Cuál es la diferencia entre RoCE e InfiniBand?
RoCE (en la práctica RoCEv2) transporta RDMA sobre Ethernet e IP estándar y enrutable, de modo que reutiliza los switches, NIC, óptica y herramientas operativas que cualquier proveedor puede suministrar. InfiniBand es una fabric aparte de propósito específico con sus propios switches, adaptadores, cableado y subnet manager de un solo proveedor. RoCEv2 mantiene la fabric sin pérdidas con PFC y ECN y controla la congestión con DCQCN, mientras que InfiniBand se apoya en el control de flujo basado en créditos que es sin pérdidas por diseño.
¿Es Ethernet tan rápido como InfiniBand para IA?
Para la mayoría de los colectivos de entrenamiento distribuido a escala, sí. InfiniBand aún tiene un piso de latencia absoluto menor por cientos de nanosegundos, pero una vez que RoCEv2 se configura con PFC, ECN, DCQCN y el balanceo de carga adaptativo, esa brecha se sitúa por debajo del nivel que cambia el tiempo de finalización del trabajo para la mayoría de las cargas de trabajo de IA. Muchos operadores ejecutan ahora grandes redes de back-end de IA sobre Ethernet por esa razón.
¿Qué es RoCEv2?
RoCEv2 (RDMA over Converged Ethernet versión 2) encapsula RDMA en UDP/IP en el puerto de destino 4791, de modo que el tráfico RDMA es enrutable a través de fabrics Ethernet de capa 3. Permite que las GPU y el almacenamiento muevan datos directamente entre memoria con baja latencia y baja sobrecarga de CPU, y por eso es la forma principal de ejecutar RDMA sobre una red Ethernet abierta y multiproveedor.
¿Necesita RoCE una fabric sin pérdidas?
Sí. El rendimiento de RoCEv2 cae bruscamente cuando se descartan paquetes, así que necesita una fabric sin pérdidas o casi sin pérdidas. Los operadores la aportan con PFC para el control de flujo salto a salto y ECN con DCQCN para el control de congestión extremo a extremo, manteniendo poco profundas las colas del switch de modo que los flujos RDMA evitan descartes y retransmisiones. El switch suministra el sustrato sin pérdidas; RoCEv2 es el transporte que corre en la NIC.
¿Puedo ejecutar RoCE sobre switches abiertos?
Sí. RoCEv2 corre sobre silicio Ethernet estándar. OcNOS-DC ofrece los bloques de construcción de RoCEv2 (PFC, PFC-con-QoS sobre capa 3, ECN, Dynamic ECN, ETS, WRED, DLB, detección y recuperación de deadlock de PFC y telemetría gNMI/OpenConfig) sobre hardware abierto validado como las plataformas Edgecore y UfiSpace construidas sobre Broadcom Tomahawk 4 y Tomahawk 5. Un solo contrato de IP Infusion cubre el software y el hardware validado.
¿Y Ultra Ethernet?
Ultra Ethernet (UEC) es el estándar abierto que lleva packet spray, RDMA multi-path, entrega fuera de orden y control de congestión moderno a Ethernet, estrechando lo que InfiniBand hacía antes de forma única. IP Infusion es miembro contribuyente del Ultra Ethernet Consortium, y OcNOS-DC se alinea hoy con el perfil de fabric UEC 1.0, con el transporte UEC completo activándose a medida que se lanzan las NIC compatibles con UEC. La alineación con el perfil no es una declaración de certificación.

¿Dimensionando una fabric RoCEv2 frente a InfiniBand? Hagamos los cálculos específicos de su carga de trabajo

Díganos la carga de trabajo y la escala de GPU, y un ingeniero de IP Infusion hará los números con usted, o empiece con un primer trazado leaf-spine en el AI Fabric Design Suite.