Redes para la neocloud: un fabric para entrenamiento e inferencia de IA
Una neocloud ejecuta entrenamiento e inferencia en la misma infraestructura. IP Infusion ofrece la red abierta para ambos: OcNOS sobre hardware abierto validado, RoCEv2 sin pérdidas para clústeres de GPU, inferencia distribuida en el borde y transporte abierto entre sedes, desde un único plano de control y un único contrato de soporte.
El entrenamiento y la inferencia tiran de la red en direcciones opuestas
Cada neocloud atiende ambos. El entrenamiento llena unos pocos clústeres grandes con tráfico constante y sincronizado. La inferencia se reparte por muchas sedes y se dispara sin aviso. El fabric tiene que hacer justicia a ambos, o las cargas de trabajo que pagan las facturas se irán a otra parte.
| Lo que ve la red | Entrenamientola fábrica de IA | Inferenciael servicio en tiempo real |
|---|---|---|
| Presencia | Unos pocos clústeres grandes de GPU | Muchas sedes regionales y de borde |
| Tráfico | Colectivos GPU a GPU masivos y sincronizados | Solicitudes pequeñas y críticas en latencia |
| Perfil de carga | Utilización de GPU sostenida y casi total durante ejecuciones largas | A ráfagas y elástico, con picos en segundos |
| La red tiene que ser | Sin pérdidas bajo ancho de banda sostenido | Baja latencia y redundancia en cada capa |
| Tolerancia a fallos | Tolerante, los trabajos guardan puntos de control y se reanudan | Baja, con SLA estrictos en cada solicitud |
¿Un fabric o dos?
Cada neocloud responde a la misma pregunta: ¿cuántas redes construye para servir entrenamiento e inferencia? La respuesta define la base de costes durante toda la vida del despliegue.
Una red de entrenamiento, más una segunda para inferencia
Un fabric para entrenamiento y otro añadido para inferencia. Dos diseños, dos reservas de repuestos, dos equipos de operaciones, dos ciclos de actualización. El coste de capital y operativo se duplica antes de que llegue el primer cliente, y el margen tiene que absorberlo todo.
Entrenamiento e inferencia en un plano de control
Ambas cargas de trabajo se ejecutan en la misma red OcNOS. Una imagen, un plano de control, un contrato de soporte. El fabric de entrenamiento y las sedes de inferencia distribuida son la misma plataforma, dimensionada y licenciada por rol, de modo que el operador capta el entrenamiento y cada carga de inferencia posterior sobre la infraestructura que ya posee.

Un fabric Ethernet sin pérdidas para los clústeres de GPU
El entrenamiento mueve tráfico masivo y sincronizado entre GPU, así que el fabric debe mantenerse sin pérdidas bajo carga. OcNOS ejecuta el conjunto de herramientas RoCEv2 sobre silicio comercial abierto a hasta 800G, de modo que la fábrica de IA obtiene un fabric Ethernet de alto radio sin una pila de un solo proveedor.
RoCEv2 sin pérdidas
Priority flow control, ECN, and DCQCN mantienen el tráfico colectivo de GPU libre de pérdida de paquetes, con balanceo de carga adaptativo para repartirlo por el fabric.
Hasta 800G sobre silicio abierto
Ethernet de alto radio sobre hardware abierto validado de varios proveedores soporta el fabric de entrenamiento, con margen para escalar el clúster.
Preparado para la pila de GPU
El fabric transporta las GPU collective libraries (NCCL, RCCL, oneCCL) sobre las que se ejecutan los trabajos de entrenamiento, de modo que la red no sea el cuello de botella en el AllReduce.
La misma imagen de OcNOS se ejecuta en cada nivel, de modo que el fabric escala con el clúster en lugar de rediseñarse en cada paso.
La inferencia vive en el borde y necesita que la red la acompañe
La inferencia se reparte por muchas sedes regionales y de borde, escala rápido en ambos sentidos y mantiene objetivos de latencia estrictos. Aquí una neocloud necesita más que un fabric de centro de datos: necesita transporte entre sedes y aseguramiento en todas ellas. IP Infusion cubre todo el trayecto.
Fabric de centro de datos en cada sede
An Leaf-spine EVPN-VXLAN sobre switches abiertos atiende cada sede de inferencia, con la elasticidad para añadir y quitar capacidad según se mueve la demanda.
Transporte abierto entre sedes
El transporte de baja latencia une las sedes. IP over DWDM with coherent ZR and ZR+ integra la capa óptica en el router para dar capacidad entre sedes.
Aseguramiento en todas las sedes
IP Maestro ofrece una única vista de todo el despliegue, para que un operador mantenga los niveles de servicio de inferencia en muchas sedes y diseños N+1.
Una base de costes que una neocloud puede defender
Una neocloud compite en precio y velocidad de escalado, así que la red no puede ser un impuesto propietario. El open networking pone al operador al mando del hardware, el software y los plazos de entrega, mientras un único proveedor sigue siendo responsable del software y el soporte.
Cadena de suministro multiproveedor
Switches from Edgecore, UfiSpace y otros ejecutan la misma imagen de OcNOS, de modo que el operador nunca queda atado a un proveedor por el hardware o los plazos.
Menor coste de hardware
OcNOS sobre switches de silicio comercial abierto soporta el AI fabric con un coste de hardware entre un 40 y un 60% menor que las plataformas propietarias a velocidades de puerto y radix comparables.
Un proveedor se hace cargo de la solución
El hardware y el software se renuevan en ciclos independientes, pero un único contrato de soporte cubre el sistema completo, de modo que un solo equipo se hace cargo de la solución.
La red abierta ya funciona a gran escala
El fabric de neocloud no es un ejercicio de laboratorio. Ejecuta el mismo OcNOS que transporta tráfico de producción para operadores de todo el mundo, sobre el mismo hardware abierto.
Redes para neocloud, respondidas
¿Qué es una neocloud?
¿Las neoclouds usan InfiniBand o Ethernet?
¿Debería una neocloud construir una red o dos para entrenamiento e inferencia?
¿Cuándo necesita una neocloud dos redes separadas?
¿Qué necesita la inferencia distribuida de la red?
¿Cómo reduce el open networking el coste de una neocloud?
Llévese la ficha técnica de OcNOS-DC
Una descarga breve y técnica que va más allá de esta página: la ficha técnica completa de OcNOS-DC.
Datasheet de OcNOS-DC
Formulario rápido. Su PDF se abre en una pestaña nueva inmediatamente después de enviarlo.
✓ Abriendo su PDF en una pestaña nueva…
Si no se ha abierto, utilice el enlace de abajo.
Diseñe su fabric de neocloud con un plano de control
Cuéntenos la escala de GPU y las sedes que planea servir, y un ingeniero de IP Infusion le ayudará a diseñar un fabric abierto para entrenamiento e inferencia.
¿Desea que nos pongamos en contacto con usted?
Déjenos sus datos y un ingeniero de IP Infusion le ayudará a diseñar un fabric abierto para entrenamiento e inferencia de IA. Solo le contactaremos si usted lo desea.