RoCE frente a InfiniBand para clústeres de IA
RoCEv2 ejecuta RDMA sobre Ethernet abierto y multiproveedor; InfiniBand es una fabric sin pérdidas de un solo proveedor. RoCEv2 se mantiene sin pérdidas con PFC y ECN y controla la congestión con DCQCN, mientras que InfiniBand es sin pérdidas por diseño mediante control de flujo basado en créditos. Para la mayoría de las cargas de trabajo de IA, Ethernet con RoCEv2 ya iguala a InfiniBand manteniendo la elección de hardware. Esta página los compara eje por eje.
Las mismas GPU, dos formas de mantenerse sin pérdidas
Izquierda: RoCEv2 sobre Ethernet mantiene las colas poco profundas con pausa PFC salto a salto, marcado ECN en el switch y control de tasa DCQCN de vuelta en la NIC emisora. Derecha: InfiniBand usa control de flujo basado en créditos, enviando solo cuando el receptor ha anunciado créditos de búfer. Ambas evitan descartes; una sobre Ethernet abierto y multiproveedor, la otra sobre una fabric de un solo proveedor.
RoCE e InfiniBand, eje por eje
RoCE es RDMA sobre Ethernet Convergente; la versión que importa para IA es RoCEv2, que encapsula RDMA en UDP/IP en el puerto de destino 4791 de modo que el tráfico es enrutable a través de una fabric Ethernet de capa 3. InfiniBand es una interconexión de propósito específico de la InfiniBand Trade Association, sin pérdidas por arquitectura mediante control de flujo basado en créditos. La pregunta práctica para un clúster de IA es qué transporte satisface la carga de trabajo manteniendo cuerdos el coste, la cadena de suministro y las operaciones.
| Axis | RoCERoCEv2 sobre Ethernet, abierto | InfiniBandfabric de un solo proveedor |
|---|---|---|
| Transport & standard | RDMA sobre UDP/IP (RoCEv2, IBTA), enrutable en capa 3 en el puerto UDP de destino 4791. Circula sobre Ethernet IEEE estándar. | Capas de enlace y transporte InfiniBand de propósito específico (IBTA), con switches dedicados y adaptadores de canal de host. |
| Cómo se mantiene sin pérdidas | PFC para el control de flujo salto a salto más ECN con DCQCN para el control de congestión extremo a extremo, manteniendo poco profundas las colas del switch de modo que RDMA evita descartes. | Control de flujo basado en créditos: un emisor transmite solo contra los créditos de búfer anunciados por el receptor, de modo que la fabric es sin pérdidas por diseño. |
| Ecosistema | Abierto y multiproveedor en cada capa: ASIC de switch, switch, NIC, NOS y óptica de proveedores independientes. | De facto de un solo proveedor para el silicio de NIC y de switch; la fabric, los adaptadores y la gestión vienen como una sola pila. |
| Elección de silicio de switch | Broadcom Tomahawk 5 (51.2 Tbps, 64x800G) y Tomahawk 4 (25.6 Tbps, 64x400G) en plataformas Edgecore y UfiSpace, entre otras. | Silicio solo del proveedor de InfiniBand; sin suministro independiente de ASIC o switch. |
| Control de congestión | DCQCN extremo a extremo: el switch marca ECN y la NIC emisora baja su tasa. El balanceo de carga adaptativo (DLB) reparte los flujos y reequilibra ante la congestión local. | Control de flujo basado en créditos con enrutamiento adaptativo incorporado en la especificación. |
| Scale | On Tomahawk 5, a 2-tier fabric reaches roughly 2,048 GPUs at 1:1 (toward 8,000+ with 800G breakout); a 3-stage Clos extends to 16,000+ and up to about 65,536 endpoints. | Escala mediante topologías de fat-tree gestionadas por un subnet manager centralizado dentro de la fabric de un proveedor. |
| Operations & tooling | Operaciones Ethernet estándar: BGP, EVPN, telemetría gNMI/OpenConfig y la misma automatización (Ansible, NETCONF) usada en todo el centro de datos. | Herramientas InfiniBand especializadas y un subnet manager, separados del resto del modelo operativo del centro de datos. |
| Bloqueo de proveedor | Ninguno inherente: combine hardware y software a voluntad, y consiga una segunda fuente en la cadena de suministro. | Alto: NIC, switch, cableado y gestión suelen venir de un solo proveedor. |
| Cost trend | Los spines de hardware abierto con OcNOS-DC a 400G y 800G socavan sustancialmente las fabrics de un solo proveedor, y la brecha se amplía a medida que suben las velocidades de puerto. | Los precios de un solo proveedor aplican un sobreprecio a igualdad de capacidad. |
InfiniBand es una marca registrada de la InfiniBand Trade Association. NVIDIA y Mellanox son marcas registradas de sus respectivos propietarios. Esta comparación se ofrece con fines informativos y no implica afiliación ni respaldo.
Dónde gana cada uno
La respuesta correcta es específica de cada carga de trabajo. Elija InfiniBand donde un piso de latencia absoluto sea el requisito; elija RoCE donde el modelo operativo, el coste o el alcance entre sitios decida.
El piso de latencia es la especificación
Simulación HPC estrechamente acoplada donde el piso de latencia absoluto NIC a NIC importa más que el coste total de propiedad, y clústeres cautivos monotenant donde una pila de un solo proveedor es aceptable.
Las operaciones y la cadena de suministro importan
GPU-as-a-Service multitenant y back-ends de IA que comparten un modelo operativo, una pila de herramientas y una cadena de suministro multiproveedor con el resto del centro de datos.
El coste por GPU es la barrera
Los spines de hardware abierto más OcNOS-DC eliminan el sobreprecio de red de un solo proveedor. En una construcción de varios miles de GPU, eso supone una porción sustancial del presupuesto de hardware.
La fabric abarca centros de datos
Ethernet se extiende de forma natural entre salas y regiones con óptica coherente 400G ZR/ZR+, sin una capa de gateway de larga distancia aparte.
Cómo ofrece OcNOS-DC el camino RoCEv2
OcNOS-DC aporta el sustrato Ethernet sin pérdidas que RoCEv2 requiere. El switch suministra las primitivas de evitación de pérdidas y de congestión; RoCEv2 es el transporte que corre en la NIC. Estas son capacidades de switch verificadas en OcNOS-DC hoy.
PFC and ECN
Priority Flow Control, incluido PFC-con-QoS sobre capa 3 con DCBX/LLDP, más ECN y Dynamic ECN de modo que los flujos RDMA mantienen colas poco profundas sin descartes.
Marcado DCQCN
El switch marca ECN de modo que el bucle DCQCN extremo a extremo bucle DCQCN de NIC-más-switch pueda limitar la tasa de los emisores. ETS y WRED conforman y gestionan las colas que transportan RDMA.
DLB y RTAG7
Balanceo de carga dinámico (incluidos Reactive Path Rebalance y Random Flow) con hash RTAG7 reparte los colectivos y reequilibra ante la congestión local.
Protección de deadlock PFC
PFC Deadlock Detection and Recovery más el ajuste de búfer mantienen estable la fabric sin pérdidas bajo la propagación de pausa que PFC puede crear.
gNMI / OpenConfig
Streaming telemetría gNMI y OpenConfig da visibilidad por prioridad para el ajuste en bucle cerrado durante la puesta en marcha del clúster y la operación en régimen estacionario.
Alineado con UEC 1.0
IP Infusion es miembro contribuyente del Ultra Ethernet Consortium, y OcNOS-DC se alinea con el Perfil de tejido UEC 1.0, de modo que la fabric se mantiene a futuro a medida que se lanzan las NIC compatibles con UEC. La alineación no es una declaración de certificación.
La elección de silicio es abierta: OcNOS-DC corre sobre el Edgecore AIS800-64D y el UfiSpace S9321-64E / S9321-64EO (el -64EO añade 400G ZR+) sobre Broadcom Tomahawk 5, y el Edgecore AS9736-64D sobre Tomahawk 4, todas plataformas on-chip y de búfer compartido ajustadas para RoCEv2. Un solo contrato de IP Infusion cubre el software y el hardware validado, con un solo TAC y un solo SLA.
Por qué muchos operadores pasan a Ethernet para los back-ends de IA
El cambio es operativo y económico más que una cuestión de latencia bruta. Tres cosas suman rápido en una construcción grande: un solo modelo de red compartido con el resto del centro de datos, una cadena de suministro multiproveedor y un menor coste por puerto a 400G y 800G.
La escala está probada en el campo. Meta ha descrito el entrenamiento de sus modelos más grandes sobre una fabric Ethernet RoCE en un clúster de 24.000 GPU, un tamaño que alguna vez se supuso que requería InfiniBand. El balanceo de carga adaptativo en Tomahawk 4 y Tomahawk 5 reasigna flujos ante la congestión en tiempo real, de modo que una fabric bien gestionada puede apuntar a una utilización superior al 90 por ciento donde el hash estático la dejaría varada. El noventa por ciento es un objetivo de diseño, no una garantía medida.
La ventaja que le queda a InfiniBand, un piso de latencia absoluto menor, sigue importando para un conjunto de cargas de trabajo HPC estrechamente acopladas. Para la mayoría de los colectivos de entrenamiento distribuido e inferencia a escala, una fabric RoCEv2 correctamente ajustada se sitúa por debajo del umbral que cambia el tiempo de finalización del trabajo, por lo que el argumento operativo y económico decide ahora la mayoría de las nuevas construcciones de back-end de IA.
- Un solo modelo de red compartido con el resto del centro de datos, de modo que las habilidades y las herramientas se trasladan.
- Una cadena de suministro multiproveedor que le permite conseguir una segunda fuente de silicio, switches, NIC y óptica.
- Menor coste por puerto a 400G y 800G, liberando capital para más GPU, un nivel de almacenamiento mayor o un segundo sitio.
Ambos son válidos, y la mayoría de los nuevos back-ends de IA aterrizan en Ethernet
InfiniBand mantiene un piso de latencia absoluto menor que un conjunto de cargas de trabajo HPC estrechamente acopladas seguirá pagando. Para la mayoría de las construcciones de back-end de IA, el argumento operativo y económico decide a favor de RoCEv2 sobre Ethernet abierto.
Ambos son válidos
InfiniBand mantiene un piso de latencia absoluto menor que un conjunto de cargas de trabajo HPC estrechamente acopladas seguirá pagando.
RoCEv2 ha cerrado la brecha para IA
Con PFC, ECN, DCQCN y el balanceo de carga adaptativo configurados correctamente, Ethernet iguala a InfiniBand en la mayoría de los colectivos de entrenamiento distribuido manteniendo la elección de hardware.
La decisión suele ser operativa
Un solo modelo de red, una cadena de suministro multiproveedor y un menor coste por puerto a 400G y 800G deciden la mayoría de las nuevas construcciones de back-end de IA.
OcNOS-DC es el camino abierto
Primitivas RoCEv2 verificadas hoy, alineadas con UEC 1.0 para el mañana, sobre hardware abierto validado de Edgecore y UfiSpace, bajo un solo contrato, un solo TAC y un solo SLA.
Obtenga el AI Fabric Reference Design
The full PDF: lossless RoCEv2 topology, switch and transceiver counts, validated platforms, and a DCQCN starting profile on OcNOS-DC.
Obtenga el AI Fabric Reference Design
Formulario breve: su PDF se descargará de inmediato tras el envío.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Preguntas frecuentes sobre RoCE frente a InfiniBand
¿Cuál es la diferencia entre RoCE e InfiniBand?
¿Es Ethernet tan rápido como InfiniBand para IA?
¿Qué es RoCEv2?
¿Necesita RoCE una fabric sin pérdidas?
¿Puedo ejecutar RoCE sobre switches abiertos?
¿Y Ultra Ethernet?
Profundice. Llévelo consigo.
El datasheet del producto y descargas técnicas y breves que profundizan más que esta página.
Datasheet de OcNOS-DC
Especificación completa de OcNOS-DC: el conjunto de funciones EVPN-VXLAN y Ethernet for AI, los SKU de software, las plataformas de hardware compatibles y la guía de pedido de la solución.
Obtener el datasheetAI Fabric sin pérdidas de 800G con OcNOS
Fabric RoCEv2 sin bloqueo sobre spines Broadcom Tomahawk 4/5: niveles de SKU, plataformas validadas y arquitectura de despliegue.
Obtener el briefFabric DC EVPN-VXLAN
Fabric de centro de datos leaf-spine de nivel operador: IRB simétrico, rutas Type-2/Type-5 y gateway anycast distribuido.
Obtener el briefDatasheet de OcNOS-DC
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
AI Fabric sin pérdidas de 800G con OcNOS
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Fabric DC EVPN-VXLAN
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
¿Dimensionando una fabric RoCEv2 frente a InfiniBand? Hagamos los cálculos específicos de su carga de trabajo
Díganos la carga de trabajo y la escala de GPU, y un ingeniero de IP Infusion hará los números con usted, o empiece con un primer trazado leaf-spine en el AI Fabric Design Suite.
Diseñe toda la fabric de IA con OcNOS
Desde el caso de negocio hasta los cálculos de recuento de puertos, retome donde esté en la construcción.