Neocloud · entrenamiento e inferencia de IA

Redes para la neocloud: un fabric para entrenamiento e inferencia de IA

Una neocloud ejecuta entrenamiento e inferencia en la misma infraestructura. IP Infusion ofrece la red abierta para ambos: OcNOS sobre hardware abierto validado, RoCEv2 sin pérdidas para clústeres de GPU, inferencia distribuida en el borde y transporte abierto entre sitios, desde un único plano de control. Con OcNOS Systems, un solo contrato de soporte cubre el hardware, el software y las ópticas.

1 fabricentrenamiento e inferencia
hasta 800GAI fabric Ethernet
40 a 60%menor coste de hardware
600+redes de operadores
Dos cargas de trabajo, un negocio

El entrenamiento y la inferencia tiran de la red en direcciones opuestas

Cada neocloud atiende ambos. El entrenamiento llena unos pocos clústeres grandes con tráfico constante y sincronizado. La inferencia se reparte por muchas sedes y se dispara sin aviso. El fabric tiene que hacer justicia a ambos, o las cargas de trabajo que pagan las facturas se irán a otra parte.

Entrenamiento frente a inferencia, según las métricas de red que definen el fabric.
Lo que ve la red Entrenamientola fábrica de IA Inferenciael servicio en tiempo real
PresenciaUnos pocos clústeres grandes de GPUMuchas sedes regionales y de borde
TráficoColectivos GPU a GPU masivos y sincronizadosSolicitudes pequeñas y críticas en latencia
Perfil de cargaUtilización de GPU sostenida y casi total durante ejecuciones largasA ráfagas y elástico, con picos en segundos
La red tiene que serSin pérdidas bajo ancho de banda sostenidoBaja latencia y redundancia en cada capa
Tolerancia a fallosTolerante, los trabajos guardan puntos de control y se reanudanBaja, con SLA estrictos en cada solicitud
La decisión de red que define su margen

¿Un fabric o dos?

Cada neocloud responde a la misma pregunta: ¿cuántas redes construye para servir entrenamiento e inferencia? La respuesta define la base de costes durante toda la vida del despliegue.

Una red de entrenamiento, más una segunda para inferencia

Un fabric para entrenamiento y otro añadido para inferencia. Dos diseños, dos reservas de repuestos, dos equipos de operaciones, dos ciclos de actualización. El coste de capital y operativo se duplica antes de que llegue el primer cliente, y el margen tiene que absorberlo todo.

Capex y opex duplicados, margen bajo presión

Entrenamiento e inferencia en un plano de control

Ambas cargas de trabajo se ejecutan en la misma red OcNOS. Una familia OcNOS, un plano de control. El fabric de entrenamiento y las sedes de inferencia distribuida son la misma plataforma, dimensionada y licenciada por rol, de modo que el operador capta el entrenamiento y cada carga de inferencia posterior sobre la infraestructura que ya posee.

Un fabric, con un coste que escala con el negocio
Un fabric OcNOS para una neocloud: a la izquierda, un clúster de entrenamiento GPU leaf-spine con RoCEv2 sin pérdidas a hasta 800G; a la derecha, sedes de inferencia distribuida, conectadas por transporte abierto IP over DWDM, todo bajo un único plano de control OcNOS.
Un fabric OcNOS para entrenamiento e inferencia: un clúster de entrenamiento GPU con RoCEv2 sin pérdidas, sedes de inferencia distribuida y transporte abierto entre ellas, bajo un único plano de control.
El fabric de entrenamiento

Un fabric Ethernet sin pérdidas para los clústeres de GPU

El entrenamiento mueve tráfico masivo y sincronizado entre GPU, así que el fabric debe mantenerse sin pérdidas bajo carga. OcNOS ejecuta el conjunto de herramientas RoCEv2 sobre silicio merchant abierto a hasta 800G, de modo que la fábrica de IA obtiene un fabric Ethernet de alto radio sin una pila de un solo proveedor.

RoCEv2 sin pérdidas

Priority flow control, ECN y DCQCN mantienen el tráfico colectivo de GPU libre de pérdida de paquetes, con balanceo de carga adaptativo para repartirlo por el fabric.

Hasta 800G sobre silicio abierto

Ethernet de alto radio sobre hardware abierto validado de varios proveedores soporta el fabric de entrenamiento, con margen para escalar el clúster.

Preparado para la pila de GPU

El fabric transporta las Bibliotecas colectivas de GPU (NCCL, RCCL, oneCCL) sobre las que se ejecutan los trabajos de entrenamiento, de modo que la red no sea el cuello de botella en el AllReduce.

Una familia OcNOS, todos los niveles de escala
Rack
Servidores GPU + leaf
La unidad con la que añades capacidad: servidores GPU tras un leaf top-of-rack.
Pod
Bloque leaf-spine
Un bloque leaf-spine sin bloqueo, el módulo repetible del fabric.
Clúster
Hasta 4,096 GPU
Un clúster de entrenamiento completo sobre un fabric RoCEv2 sin pérdidas.
Multiclúster
Diseños de 16,384 GPU
Varios clústeres más sedes de inferencia distribuida, bajo un plano de control.

OcNOS funciona en todos los niveles, de modo que el fabric escala con el clúster en lugar de rediseñarse en cada paso.

Inferencia distribuida

La inferencia vive en el borde y necesita que la red la acompañe

La inferencia se reparte por muchas sedes regionales y de borde, escala rápido en ambos sentidos y mantiene objetivos de latencia estrictos. Aquí una neocloud necesita más que un fabric de centro de datos: necesita transporte entre sedes y aseguramiento en todas ellas. IP Infusion cubre todo el trayecto.

Fabric de centro de datos en cada sede

Un fabric leaf-spine EVPN-VXLAN sobre switches abiertos atiende cada sede de inferencia, con la elasticidad para añadir y quitar capacidad según se mueve la demanda.

Transporte abierto entre sedes

El transporte de baja latencia une las sedes. IP sobre DWDM con ZR y ZR+ coherentes integra la capa óptica en el router para dar capacidad entre sedes.

Aseguramiento en todas las sedes

IP Maestro ofrece una única vista de todo el despliegue, para que un operador mantenga los niveles de servicio de inferencia en muchas sedes y diseños N+1.

Hardware abierto, menor coste

Una base de costes que una neocloud puede defender

Una neocloud compite en precio y velocidad de escalado, así que la red no puede ser un impuesto propietario. El open networking pone al operador al mando del hardware, el software y los plazos de entrega, mientras un único proveedor sigue siendo responsable del software y el soporte.

Cadena de suministro multiproveedor

Switches de Edgecore, UfiSpace y otros ejecutan OcNOS, de modo que el operador nunca queda atado a un solo proveedor en hardware ni en plazos de entrega.

Menor coste de hardware

OcNOS sobre switches de silicio merchant abierto soporta el AI fabric con un coste de hardware entre un 40 y un 60% menor que las plataformas propietarias a velocidades de puerto y radix comparables.

Un proveedor se hace cargo de la solución

El hardware y el software se renuevan en ciclos independientes. Con OcNOS Systems, un solo contrato de soporte cubre el hardware, el software y las ópticas, de modo que un solo equipo se encarga de la solución.

Probado en producción

La red abierta ya funciona a gran escala

El fabric de neocloud no es un ejercicio de laboratorio. Ejecuta el mismo OcNOS que transporta tráfico de producción para operadores de todo el mundo, sobre el mismo hardware abierto.

600+
redes de operadores funcionan sobre OcNOS en proveedores de servicios, centros de datos y puntos de intercambio de internet.
60+
países donde OcNOS transporta hoy tráfico de producción en vivo.
40+
plataformas de hardware abierto validadas ejecutan OcNOS.

Redes para neocloud, respondidas

¿Qué es una neocloud?
Una neocloud es un proveedor de nube AI-first construido en torno a cómputo GPU denso para entrenamiento e inferencia, en lugar de los servicios de propósito general de un hyperscaler tradicional. Las neoclouds compiten por el rendimiento puro del acelerador, la rapidez de escalado y el coste, así que la red que transporta el tráfico de GPU es una parte central de la economía, no un añadido.
¿Qué fabric utilizan los neoclouds para entrenamiento e inferencia?
OcNOS ejecuta el fabric del neocloud sobre Ethernet con RoCEv2, en hardware abierto validado de silicio merchant de hasta 800G. El control de flujo por prioridad, ECN y el balanceo de carga adaptativo mantienen sin pérdidas el tráfico colectivo de GPU, de modo que un neocloud obtiene un único AI fabric Ethernet para entrenamiento e inferencia sin una pila de un solo proveedor.
¿Debería una neocloud construir una red o dos para entrenamiento e inferencia?
El entrenamiento y la inferencia son cargas opuestas: el entrenamiento es centralizado y exige ancho de banda, la inferencia es distribuida, a ráfagas y crítica en latencia. Construir dos redes separadas duplica el coste de capital y operativo. Ejecutar ambas en un solo fabric OcNOS con un plano de control permite a una neocloud servir el entrenamiento y cada carga de inferencia desde la misma infraestructura, que es donde mejora el margen operativo.
¿Cuándo necesita una neocloud dos redes separadas?
Algunos operadores separan el entrenamiento y la inferencia a propósito, y hay buenas razones para hacerlo: aislamiento estricto entre inquilinos, dominios operativos distintos para diferentes equipos, un límite de rendimiento estricto o un fabric de entrenamiento existente que el operador conserva. OcNOS funciona de ambas maneras. Lo importante es que la separación sea una decisión de diseño deliberada, no un coste que la arquitectura le imponga. Cuando un solo equipo puede ejecutar ambas cargas de trabajo en un único plano de control, un fabric dimensionado y licenciado por rol es la opción predeterminada que protege el margen.
¿Qué necesita la inferencia distribuida de la red?
La inferencia se reparte por muchas sedes regionales y de borde, escala rápido en ambos sentidos y mantiene objetivos de latencia estrictos, así que la red necesita capacidad elástica, redundancia en cada capa y transporte de baja latencia entre sedes. IP Infusion cubre todo el trayecto: el fabric de centro de datos, el transporte e IP over DWDM entre sedes, e IP Maestro para el aseguramiento.
¿Cómo reduce el open networking el coste de una neocloud?
Un neocloud compra switches y software en ciclos independientes a través de una cadena de suministro multiproveedor, por lo que no está atado a un solo proveedor en hardware, software ni plazos de entrega. OcNOS en switches abiertos de silicio merchant transporta el AI fabric con un coste de hardware inferior al de las plataformas propietarias, e IP Infusion da soporte al software OcNOS. Con OcNOS Systems, un solo contrato de soporte cubre el hardware, el software y las ópticas.

Diseñe su fabric de neocloud con un plano de control

Cuéntenos la escala de GPU y las sedes que planea servir, y un ingeniero de IP Infusion le ayudará a diseñar un fabric abierto para entrenamiento e inferencia.