InfiniBand frente a Ethernet para AI Fabrics
Para la mayoría de las fabrics de IA, Ethernet. Para HPC con latencia crítica, InfiniBand. El Ethernet moderno con RoCEv2 ya opera fabrics de producción a 400G y 800G sobre hardware abierto y multiproveedor, y OcNOS-DC lo ofrece hoy. Esta guía cubre dónde sigue encajando cada uno.
Las mismas GPU, dos redes muy distintas
A la izquierda, una fabric InfiniBand de un solo proveedor: un único proveedor de silicio, una línea de switches, un ecosistema de NIC y un subnet manager separado del resto del centro de datos. A la derecha, una fabric Ethernet abierta y multiproveedor: NIC RoCEv2 o UEC de cualquier proveedor, silicio de switch Broadcom, OcNOS-DC como NOS y los mismos protocolos que ya ejecuta.
InfiniBand y Ethernet, eje por eje
InfiniBand se diseñó a propósito para RDMA sin pérdidas y de baja latencia, y durante dos décadas eso le dio una ventaja real en HPC fuertemente acoplado. El Ethernet moderno, construido sobre la pila DCB, RoCEv2 y cada vez más DLB y UEC, ha dedicado los últimos años a cerrar esa brecha. Qué brechas siguen importando depende de la carga de trabajo.
| Axis | InfiniBandsingle-vendor | EthernetRoCEv2 / UEC, abierto |
|---|---|---|
| Piso de latencia | Latencia NIC a NIC de extremo a extremo muy baja; típicamente cientos de nanosegundos por salto de switch. | Un piso más alto que IB por cientos de nanosegundos, pero muy por debajo del umbral que afecta a la mayoría de los collectives de entrenamiento distribuido a escala. |
| Tolerancia a pérdidas | Sin pérdidas por arquitectura (control de flujo basado en créditos). | Sin pérdidas mediante PFC + ECN + DCQCN. De nivel producción hoy mismo; UEC reduce aún más la dependencia de la pausa PFC. |
| Múltiples rutas / balanceo de carga | Enrutamiento adaptativo integrado en la especificación. | ECMP estático, además de DLB para el adaptativo de un solo salto, GLB (OcNOS 7.1) para el extremo a extremo y UEC packet-spray para la próxima generación. |
| Ecosistema de proveedores | Prácticamente de un solo proveedor tanto para el silicio de NIC como de switch. | Multiproveedor en cada capa: ASIC, switch, NIC, NOS, óptica. UEC está diseñado explícitamente para la interoperabilidad neutral respecto al proveedor. |
| Modelo operativo | Subnet manager (de clase UFM). Distinto del resto del DC. Habilidades separadas, herramientas separadas. | El mismo BGP, EVPN y gNMI que usted ya utiliza. Las mismas herramientas de automatización (Ansible, NETCONF, OpenConfig) que el resto del DC. |
| Multi-tenancy | Limitado; existe la partición, pero no es un concepto de primer nivel. | De primer nivel mediante EVPN-VXLAN. GPU-as-a-Service, clústeres multiequipo e infraestructura compartida, todo de forma natural. |
| DCI de larga distancia | No está diseñado para ello; requiere gateways de IB-over-WAN. | Nativo mediante pluggables coherentes 400G ZR/ZR+ y EVPN inter-DC. |
| Convergencia de almacenamiento | El almacenamiento se ejecuta junto al cómputo; requiere almacenamiento conectado por IB. | NVMe-oF, NFS, S3, todos sobre la misma fabric Ethernet. |
| Costo / puerto (típico 400G+) | Sobreprecio; precios de un solo proveedor. | Un spine de hardware abierto + NOS OcNOS-DC supera de forma sustancial a las alternativas con bloqueo de proveedor. |
| Velocidad de la hoja de ruta | Impulsado por la cadencia de versiones de un único proveedor. | El consorcio UEC (AMD, Arista, Broadcom, Cisco, HPE, Intel, Meta, Microsoft, Oracle) impulsa una evolución de especificación publicada abiertamente. |
Dónde gana cada uno
La respuesta correcta es específica de cada carga de trabajo. Elija InfiniBand donde un piso de latencia absoluto sea el requisito; elija Ethernet donde el modelo operativo, el coste o el alcance entre sitios decida.
El piso de latencia es contractual
Simulación HPC donde el piso de latencia absoluto importa más que el coste total de propiedad, y clústeres cautivos, monotenant y estrechamente acoplados donde el bloqueo propietario es aceptable.
El modelo operativo importa
GPU-as-a-Service multitenant y clústeres que comparten infraestructura con el resto del centro de datos, donde ganan un solo modelo operativo, una sola pila de herramientas y una cadena de suministro multiproveedor.
El coste por GPU-flop es la barrera
Los spines de hardware abierto con OcNOS-DC eliminan el sobreprecio de red de un solo proveedor. En un clúster de varios miles de GPU, eso supone una porción sustancial del presupuesto de hardware.
La fabric abarca centros de datos
Si un entrenamiento llegará a cruzar alguna vez dos salas o dos regiones, el DCI coherente, el EVPN inter-DC y la óptica estándar multiproveedor lo convierten en un problema de un día en lugar de un proyecto de line-system de un trimestre.
Qué añadió el Ethernet moderno
Tres avances llevaron las fabrics de IA de producción a Ethernet: un comportamiento genuinamente sin pérdidas, un enrutamiento adaptativo que mantiene los flujos fuera de los enlaces ascendentes congestionados y un transporte de nueva generación apto para packet spray.
Comportamiento sin pérdidas
RoCEv2 with PFC, DCQCN y el watchdog de deadlock de PFC ofrecen el transporte RDMA sin pérdidas que necesitan los colectivos de IA, con grado de producción hoy sobre Ethernet estándar.
Enrutamiento adaptativo
Las colisiones ECMP estáticas en cargas de AI son reales, pero DLB reasigna flowlets ante la congestión local en ventanas de submilisegundos, y GLB en OcNOS 7.1 lo extiende a una puntuación de ruta extremo a extremo.
Transporte apto para packet spray
Ultra Ethernet (UEC 1.0, junio de 2025) trae packet spray, RDMA multi-path y entrega fuera de orden a Ethernet estándar. Construya sobre RoCEv2 ahora y mantenga un camino limpio hacia UEC a medida que se lancen las NIC.
La red es una partida pequeña, así que dedique la comparación a lo que libera
A lo largo de cinco años la capa de conmutación es un porcentaje de un solo dígito del TCO del clúster, que sube al contar NIC, óptica y cableado. La pregunta útil no es la partida, sino qué financia el capital ahorrado.
- A igualdad de capacidad, InfiniBand de un solo proveedor aplica un sobreprecio frente a Ethernet de hardware abierto.
- El capital ahorrado financia más GPU, un nivel de almacenamiento mayor o un segundo sitio para resiliencia.
- Donde la fabric es multitenant o compartida con el resto del centro de datos, un solo modelo de red vale más que la diferencia de partida.
Ambos tienen su lugar, y la mayoría de las fabrics de IA pertenecen a Ethernet
Ethernet no gana en toda carga de trabajo, pero el argumento operativo y económico es decisivo para la mayoría, y se refuerza a medida que se cierra la brecha técnica.
Ambos tienen su lugar
Ethernet no gana en toda carga de trabajo. Los clústeres HPC estrechamente acoplados con requisitos de latencia de piso absoluto siguen favoreciendo a InfiniBand.
La mayoría de las fabrics de IA pertenecen a Ethernet
El entrenamiento y la inferencia de IA en producción a hiperescala están migrando a Ethernet a medida que crece el argumento operativo y económico y sigue cerrándose la brecha técnica.
OcNOS-DC es el camino abierto
RoCEv2 hoy, DLB hoy, GLB a continuación, UEC a medida que se entreguen las NICs. Un solo NOS, una sola hoja de ruta de funciones, sobre hardware abierto validado de Edgecore, UfiSpace y otros.
InfiniBand frente a Ethernet, respondido
¿Es Ethernet lo bastante rápido para el entrenamiento de AI frente a InfiniBand?
¿En qué casos conviene aún elegir InfiniBand?
¿En qué casos Ethernet resulta preferible para una AI fabric?
¿Cómo reduce OcNOS la diferencia con InfiniBand?
¿Están los hiperescaladores reemplazando InfiniBand por Ethernet para IA?
¿Cuál es la mejor alternativa a InfiniBand para la red de un clúster de IA?
¿Cuál es la diferencia entre Ultra Ethernet e InfiniBand?
¿Cuánto cuesta una fabric Ethernet de IA en comparación con InfiniBand?
Profundice. Llévelo consigo.
El datasheet del producto y descargas técnicas y breves que profundizan más que esta página.
Datasheet de OcNOS-DC
Especificación completa de OcNOS-DC: el conjunto de funciones EVPN-VXLAN y Ethernet for AI, los SKU de software, las plataformas de hardware compatibles y la guía de pedido de la solución.
Obtener el datasheetAI Fabric sin pérdidas de 800G con OcNOS
Fabric RoCEv2 sin bloqueo sobre spines Broadcom Tomahawk 4/5: niveles de SKU, plataformas validadas y arquitectura de despliegue.
Obtener el briefFabric DC EVPN-VXLAN
Fabric de centro de datos leaf-spine de nivel operador: IRB simétrico, rutas Type-2/Type-5 y gateway anycast distribuido.
Obtener el briefDatasheet de OcNOS-DC
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
AI Fabric sin pérdidas de 800G con OcNOS
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Fabric DC EVPN-VXLAN
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
¿Dimensionando su próximo clúster? Obtenga una revisión específica de su carga de trabajo
Díganos la carga de trabajo y la escala de GPU, y un ingeniero de IP Infusion hará los cálculos con usted, o empiece con un primer trazado leaf-spine en el AI Fabric Design Suite.
Diseñe toda la fabric de IA con OcNOS
Desde el caso de negocio hasta los cálculos de recuento de puertos, retome donde esté en la construcción.