Neocloud · AI training and inference

Redes para la neocloud: un fabric para entrenamiento e inferencia de IA

Una neocloud ejecuta entrenamiento e inferencia en la misma infraestructura. IP Infusion ofrece la red abierta para ambos: OcNOS sobre hardware abierto validado, RoCEv2 sin pérdidas para clústeres de GPU, inferencia distribuida en el borde y transporte abierto entre sedes, desde un único plano de control y un único contrato de soporte.

1 fabricentrenamiento e inferencia
hasta 800GAI fabric Ethernet
40 a 60%menor coste de hardware
600+redes de operadores
Dos cargas de trabajo, un negocio

El entrenamiento y la inferencia tiran de la red en direcciones opuestas

Cada neocloud atiende ambos. El entrenamiento llena unos pocos clústeres grandes con tráfico constante y sincronizado. La inferencia se reparte por muchas sedes y se dispara sin aviso. El fabric tiene que hacer justicia a ambos, o las cargas de trabajo que pagan las facturas se irán a otra parte.

Entrenamiento frente a inferencia, según las métricas de red que definen el fabric.
Lo que ve la red Entrenamientola fábrica de IA Inferenciael servicio en tiempo real
PresenciaUnos pocos clústeres grandes de GPUMuchas sedes regionales y de borde
TráficoColectivos GPU a GPU masivos y sincronizadosSolicitudes pequeñas y críticas en latencia
Perfil de cargaUtilización de GPU sostenida y casi total durante ejecuciones largasA ráfagas y elástico, con picos en segundos
La red tiene que serSin pérdidas bajo ancho de banda sostenidoBaja latencia y redundancia en cada capa
Tolerancia a fallosTolerante, los trabajos guardan puntos de control y se reanudanBaja, con SLA estrictos en cada solicitud
La decisión de red que define su margen

¿Un fabric o dos?

Cada neocloud responde a la misma pregunta: ¿cuántas redes construye para servir entrenamiento e inferencia? La respuesta define la base de costes durante toda la vida del despliegue.

Option A · two networks

Una red de entrenamiento, más una segunda para inferencia

Un fabric para entrenamiento y otro añadido para inferencia. Dos diseños, dos reservas de repuestos, dos equipos de operaciones, dos ciclos de actualización. El coste de capital y operativo se duplica antes de que llegue el primer cliente, y el margen tiene que absorberlo todo.

Capex y opex duplicados, margen bajo presión
Option B · one OcNOS fabric

Entrenamiento e inferencia en un plano de control

Ambas cargas de trabajo se ejecutan en la misma red OcNOS. Una imagen, un plano de control, un contrato de soporte. El fabric de entrenamiento y las sedes de inferencia distribuida son la misma plataforma, dimensionada y licenciada por rol, de modo que el operador capta el entrenamiento y cada carga de inferencia posterior sobre la infraestructura que ya posee.

Un fabric, con un coste que escala con el negocio
Un fabric OcNOS para una neocloud: a la izquierda, un clúster de entrenamiento GPU leaf-spine con RoCEv2 sin pérdidas a hasta 800G; a la derecha, sedes de inferencia distribuida, conectadas por transporte abierto IP over DWDM, todo bajo un único plano de control OcNOS.
Un fabric OcNOS para entrenamiento e inferencia: un clúster de entrenamiento GPU con RoCEv2 sin pérdidas, sedes de inferencia distribuida y transporte abierto entre ellas, bajo un único plano de control.
El fabric de entrenamiento

Un fabric Ethernet sin pérdidas para los clústeres de GPU

El entrenamiento mueve tráfico masivo y sincronizado entre GPU, así que el fabric debe mantenerse sin pérdidas bajo carga. OcNOS ejecuta el conjunto de herramientas RoCEv2 sobre silicio comercial abierto a hasta 800G, de modo que la fábrica de IA obtiene un fabric Ethernet de alto radio sin una pila de un solo proveedor.

RoCEv2 sin pérdidas

Priority flow control, ECN, and DCQCN mantienen el tráfico colectivo de GPU libre de pérdida de paquetes, con balanceo de carga adaptativo para repartirlo por el fabric.

Hasta 800G sobre silicio abierto

Ethernet de alto radio sobre hardware abierto validado de varios proveedores soporta el fabric de entrenamiento, con margen para escalar el clúster.

Preparado para la pila de GPU

El fabric transporta las GPU collective libraries (NCCL, RCCL, oneCCL) sobre las que se ejecutan los trabajos de entrenamiento, de modo que la red no sea el cuello de botella en el AllReduce.

Una imagen, cada nivel de escala
Rack
Servidores GPU + leaf
La unidad con la que añades capacidad: servidores GPU tras un leaf top-of-rack.
Pod
Bloque leaf-spine
Un bloque leaf-spine sin bloqueo, el módulo repetible del fabric.
Clúster
Hasta 4,096 GPU
Un clúster de entrenamiento completo sobre un fabric RoCEv2 sin pérdidas.
Multiclúster
Diseños de 16,384 GPU
Varios clústeres más sedes de inferencia distribuida, bajo un plano de control.

La misma imagen de OcNOS se ejecuta en cada nivel, de modo que el fabric escala con el clúster en lugar de rediseñarse en cada paso.

Inferencia distribuida

La inferencia vive en el borde y necesita que la red la acompañe

La inferencia se reparte por muchas sedes regionales y de borde, escala rápido en ambos sentidos y mantiene objetivos de latencia estrictos. Aquí una neocloud necesita más que un fabric de centro de datos: necesita transporte entre sedes y aseguramiento en todas ellas. IP Infusion cubre todo el trayecto.

Fabric de centro de datos en cada sede

An Leaf-spine EVPN-VXLAN sobre switches abiertos atiende cada sede de inferencia, con la elasticidad para añadir y quitar capacidad según se mueve la demanda.

Transporte abierto entre sedes

El transporte de baja latencia une las sedes. IP over DWDM with coherent ZR and ZR+ integra la capa óptica en el router para dar capacidad entre sedes.

Aseguramiento en todas las sedes

IP Maestro ofrece una única vista de todo el despliegue, para que un operador mantenga los niveles de servicio de inferencia en muchas sedes y diseños N+1.

Hardware abierto, menor coste

Una base de costes que una neocloud puede defender

Una neocloud compite en precio y velocidad de escalado, así que la red no puede ser un impuesto propietario. El open networking pone al operador al mando del hardware, el software y los plazos de entrega, mientras un único proveedor sigue siendo responsable del software y el soporte.

Cadena de suministro multiproveedor

Switches from Edgecore, UfiSpace y otros ejecutan la misma imagen de OcNOS, de modo que el operador nunca queda atado a un proveedor por el hardware o los plazos.

Menor coste de hardware

OcNOS sobre switches de silicio comercial abierto soporta el AI fabric con un coste de hardware entre un 40 y un 60% menor que las plataformas propietarias a velocidades de puerto y radix comparables.

Un proveedor se hace cargo de la solución

El hardware y el software se renuevan en ciclos independientes, pero un único contrato de soporte cubre el sistema completo, de modo que un solo equipo se hace cargo de la solución.

Probado en producción

La red abierta ya funciona a gran escala

El fabric de neocloud no es un ejercicio de laboratorio. Ejecuta el mismo OcNOS que transporta tráfico de producción para operadores de todo el mundo, sobre el mismo hardware abierto.

600+
redes de operadores funcionan sobre OcNOS en proveedores de servicios, centros de datos y puntos de intercambio de internet.
60+
países donde OcNOS transporta hoy tráfico de producción en vivo.
40+
plataformas de hardware abierto validadas ejecutan OcNOS desde una sola imagen.
Preguntas frecuentes

Redes para neocloud, respondidas

¿Qué es una neocloud?
Una neocloud es un proveedor de nube AI-first construido en torno a cómputo GPU denso para entrenamiento e inferencia, en lugar de los servicios de propósito general de un hyperscaler tradicional. Las neoclouds compiten por el rendimiento puro del acelerador, la rapidez de escalado y el coste, así que la red que transporta el tráfico de GPU es una parte central de la economía, no un añadido.
¿Las neoclouds usan InfiniBand o Ethernet?
Se despliegan ambos, y con la llegada de 800G la industria se inclina hacia Ethernet. Ethernet con RoCEv2 transporta el tráfico colectivo de GPU sobre silicio comercial abierto, así que una neocloud obtiene un AI fabric sin pérdidas sin una pila de un solo proveedor. OcNOS ejecuta el conjunto completo de RoCEv2, priority flow control, ECN y balanceo de carga adaptativo, sobre hardware abierto validado.
¿Debería una neocloud construir una red o dos para entrenamiento e inferencia?
El entrenamiento y la inferencia son cargas opuestas: el entrenamiento es centralizado y exige ancho de banda, la inferencia es distribuida, a ráfagas y crítica en latencia. Construir dos redes separadas duplica el coste de capital y operativo. Ejecutar ambas en un solo fabric OcNOS con un plano de control permite a una neocloud servir el entrenamiento y cada carga de inferencia desde la misma infraestructura, que es donde mejora el margen operativo.
¿Cuándo necesita una neocloud dos redes separadas?
Algunos operadores separan el entrenamiento y la inferencia a propósito, y hay buenas razones para ello: aislamiento estricto entre inquilinos, dominios operativos distintos para equipos diferentes, un límite de rendimiento rígido o una isla InfiniBand existente que ya soporta el entrenamiento. OcNOS funciona en cualquiera de los dos casos. La clave es que la separación debe ser una decisión de diseño deliberada, no un coste que la arquitectura te impone. Cuando un mismo equipo puede ejecutar ambas cargas en un plano de control, un fabric dimensionado y licenciado por rol es la opción por defecto que protege el margen.
¿Qué necesita la inferencia distribuida de la red?
La inferencia se reparte por muchas sedes regionales y de borde, escala rápido en ambos sentidos y mantiene objetivos de latencia estrictos, así que la red necesita capacidad elástica, redundancia en cada capa y transporte de baja latencia entre sedes. IP Infusion cubre todo el trayecto: el fabric de centro de datos, el transporte e IP over DWDM entre sedes, e IP Maestro para el aseguramiento.
¿Cómo reduce el open networking el coste de una neocloud?
Una neocloud compra switches y software en ciclos independientes desde una cadena de suministro multiproveedor, así que no queda atada a un proveedor por el hardware, el software o los plazos. OcNOS sobre switches de silicio comercial abierto soporta el AI fabric con un coste de hardware menor que las plataformas propietarias, y un único proveedor sigue siendo responsable del software y el soporte bajo un solo contrato.

Diseñe su fabric de neocloud con un plano de control

Cuéntenos la escala de GPU y las sedes que planea servir, y un ingeniero de IP Infusion le ayudará a diseñar un fabric abierto para entrenamiento e inferencia.