Herramienta de diseño de AI fabric

Diseñe de extremo a extremo un fabric de GPU RoCEv2 sin bloqueo, con neutralidad de proveedor. Dimensione los conmutadores leaf y spine, planifique el número de transceptores y cables, compare InfiniBand con Ethernet para su clúster y obtenga un perfil de congestión sin pérdidas. Esta herramienta solo diseña la red. No constituye una estimación de coste ni una lista de materiales.

Step 1

Dimensionar la fabric de GPU

Elija un tamaño de partida o introduzca su propio número de GPU, velocidad de puerto y silicio de conmutación. La herramienta dimensiona un pod leaf-spine de dos niveles plegado e indica cuándo un clúster pasa a la escala de tres niveles.

SPINE Spine 1Spine 2Spine 3 LEAF Leaf 1Leaf 2Leaf 3Leaf 4 GPU SERVERS
conmutadores leaf
conmutadores spine
total de conmutadores

Estas cifras suponen una leaf-spine (Clos) fabric plegada con una fabric NIC por GPU, en la que cada leaf reparte sus puertos entre los GPU y los enlaces ascendentes hacia los spines. Un cableado rail-optimized (varias NIC por GPU) modifica la localidad del tráfico, no estos recuentos de conmutadores. Consulte el Diseños de referencia de topología de AI fabric para las topologías rail-optimized y de tres niveles.

Step 2

Resumen de componentes

Cantidades de enlaces fabric, transceptores y cables para el diseño dimensionado. Son cifras de planificación únicamente, no una lista de materiales, un presupuesto ni una tarifa.

ComponentBasisQuantity
Enlaces hacia los GPUGPUs × 1 NIC
Enlaces de fabric de leaf a spineleaves × uplinks
Transceptores fabriclinks × 2 ends
Cables de fabric1 por enlace

El medio según el alcance, elegido en función de su cableado: hasta 3 m con DAC o AEC, hasta 50 a 100 m con AOC o SR, hasta 500 m con DR (la opción de referencia), hasta 2 km con FR. Solo clases de alcance. Sin precios, SKU ni referencias de proveedor. En un diseño de tres niveles, añada los enlaces de spine a super-spine además de las cifras anteriores.

Decision

InfiniBand frente a Ethernet

Un cuadro de mando neutral respecto al proveedor, sobre seis factores. Muestra hacia dónde se inclina cada factor según sus datos y por qué. Por diseño, aquí no hay un único ganador. Utilícelo como elemento de entrada para una revisión de diseño, no como recomendación final.

FactorInfiniBandEthernet / RoCEv2Ultra Ethernet (trajectory)
Rendimiento máximose inclina por InfiniBandUna ventaja de rendimiento bruto de en torno al 15 por ciento con un esfuerzo de ajuste reducido, además de la reducción in-network SHARP que descarga las operaciones colectivas de las GPU.Matches InfiniBand with proper tuning. Meta has described training its largest models on a 24,000-GPU RoCEv2 Ethernet cluster in production. The gap is tuning effort, not the ceiling.Añade packet spray y reordenamiento del lado de la NIC para reducir la latencia de cola y disminuir la dependencia del PFC, estrechando la diferencia de fábrica.
Costse inclina hacia EthernetConlleva un sobrecoste apreciable a escala de fabric, habitualmente situado en el rango del 30 al 60 por ciento frente a un Ethernet comparable.Los conmutadores merchant-silicon y una amplia cadena de suministro de óptica la convierten, por lo general, en la fabric de menor coste por puerto.La misma economía de merchant silicon abierto que Ethernet.
Aperturase inclina hacia EthernetPila de un único proveedor de extremo a extremo (conmutadores, NIC, gestor), por lo que el aprovisionamiento multiproveedor es limitado.Abierto y multifabricante: conmutadores, NIC y NOS basados en estándares de múltiples proveedores, preservando la flexibilidad de la cadena de suministro.Estándar de consorcio industrial (UEC 1.0, 2025) que refuerza la orientación abierta.
Simplicidad operativaneutralUFM proporciona un gestor de fabric único y específico, listo para usar para equipos que no cuentan con personal experto en RDMA.Aprovecha la amplia base de talento en Ethernet y el instrumental estándar, pero un RoCEv2 sin pérdidas requiere un ajuste extremo a extremo meticuloso.Su objetivo es reducir la carga de optimización, acercando Ethernet a un comportamiento listo para usar similar al de IB.
Multi-tenancy y convergenciase inclina hacia EthernetHabitualmente una isla de back-end dedicada, sin aislamiento multi-tenant nativo ni convergencia de almacenamiento.Una única fabric Ethernet convergente puede transportar el tráfico back-end, de almacenamiento y front-end con aislamiento de inquilinos estándar.Amplía la orientación converged-Ethernet sobre una única fabric abierta.
Trajectoryse inclina hacia EthernetMaduro y estable, con un rendimiento destacado con un ajuste reducido, pero sujeto a la hoja de ruta de un único proveedor.Ethernet pasó a liderar los despliegues de back-end de IA hacia mediados de 2025, con un amplio impulso del ecosistema.UEC 1.0 (2025) es una especificación multiproveedor orientada explícitamente a las back-end fabrics de IA y HPC.

Supuestos: el rendimiento se compara con optimización (el Ethernet sin optimizar queda por detrás, el Ethernet bien optimizado alcanza la paridad); el coste se expresa como un rango, nunca como una cifra monetaria; la apertura significa abastecimiento multiproveedor, no un juicio de calidad; Ultra Ethernet refleja una orientación a partir de 2025, no un producto disponible. La optimización colectiva hace referencia de forma genérica a las bibliotecas xCCL. Esta información orienta la decisión; valide cualquier elección de fabric con un ingeniero de IP Infusion.

Perfil

Perfil sin pérdidas RoCEv2

RoCEv2 no es una única funcionalidad de conmutador. Es un perfil compuesto por PFC, ECN y ETS, en el que DCQCN realiza el trabajo en régimen permanente y PFC actúa como salvaguarda. Esta herramienta recomienda los mecanismos y el orden de aplicación para su diseño. No emite valores de umbral ni interviene en ningún dispositivo.

MechanismFunción en el perfil sin pérdidasDisponibilidad de OcNOS
PFCGarantía de no descarte para la clase RoCE. Salvaguarda de último recurso, no el control principal.Las 4 plataformas de AI
ECNMarca la congestión de forma temprana para que los emisores reduzcan su tasa antes de que las colas se desborden. Ajuste su punto de marcado por debajo del disparador de PFC.Las 4 plataformas de AI
DCQCN (ECN + PFC)Control principal en régimen estable. El marcado ECN impulsa la reacción DCQCN en las NIC; el PFC actúa como respaldo. Un mecanismo compuesto, no una función independiente.Las 4 plataformas de AI
ETSGarantías de ancho de banda y aislamiento de clases para que la clase sin pérdidas no se vea privada de recursos por el tráfico best-effort.Las 4 plataformas de AI
Watchdog de interbloqueo PFCDetecta y rompe las condiciones de interbloqueo o tormenta de pausas PFC: la red de seguridad del mecanismo de respaldo PFC.Los 4, OcNOS 7.0
DLB (equilibrado de carga dinámico)Spreads elephant RoCE flows that collide under static ECMP, targeting utilization above 90 percent on the same switches.Las 4 plataformas de AI
ECN dinámicoAdapta el marcado ECN a las condiciones de cola en tiempo real, reduciendo el reajuste manual a medida que cambia la carga.Solo TH5, OcNOS 7.0
DLB reactivo / aleatorioModos avanzados de colocación DLB para una distribución de flujos más ajustada. En TH4, utilice DLB estándar.Solo TH5, OcNOS 7.0
GLB (Global Load Balancing)Balanceo de carga en toda la fabric, más allá de las decisiones DLB locales.Hoja de ruta, rama OcNOS 7.1
Ultra EthernetPacket spray con reordenación en el lado de la NIC y menor dependencia del PFC, la trayectoria hacia el Ethernet de AI lossless.Hoja de ruta, perfil UEC

Solo con carácter orientativo. Estas recomendaciones no se envían a ningún dispositivo y aquí no se generan valores de umbral. La disponibilidad se ajusta a lo indicado en OcNOS-DC. Matriz de funciones and Lista de compatibilidad de hardware. Valide con respecto a las plataformas seleccionadas y a la versión de OcNOS antes del despliegue.

Estimate

Consumo de la fabric

Un rango de potencia típico para los conmutadores de la fabric en el diseño dimensionado. Solo rangos, con las ópticas instaladas. Los conmutadores de red representan una pequeña parte de la potencia total del cluster; los GPU predominan.

kW valor bajo típico
kW a plena carga

Refrigeración: la refrigeración por puerta trasera o por líquido directo se suele plantear por encima de unos 30 a 40 kW por rack, motivada por la densidad de los servidores GPU y no por la red. Se trata de una orientación, no de una carga térmica calculada. Los rangos de consumo de los conmutadores son valores típicos para equipos de clase 51,2T (Tomahawk 5) y 25,6T (Tomahawk 4) con óptica instalada; confirme las cifras exactas en la ficha técnica de cada plataforma.

Plataformas OcNOS-DC correspondientes

La fabric ejecuta una única imagen de OcNOS-DC sobre hardware abierto Broadcom Tomahawk. Estas son las plataformas 800G y 400G compatibles sobre las que se diseña.

Esta herramienta ofrece una estimación estructural de diseño de red únicamente con fines de planificación. No constituye una garantía de rendimiento, una lista de materiales ni una estimación de costes. Los diseños reales dependen de la optimización de raíles, del número de NIC por GPU, del cableado y de las decisiones sobre el dominio de fallo. Los números de GPU son topes de diseño de referencia derivados del cálculo de radix Clos, no valores medidos. Broadcom y Tomahawk son marcas comerciales de Broadcom Inc.; los demás nombres son marcas comerciales de sus respectivos titulares.

Recurso

Diseño de referencia de AI fabric

Obtenga el PDF de diseño de referencia: topología, número de switches, resumen de componentes y un perfil inicial RoCEv2 sin pérdidas.

Descargar PDF
Preguntas frecuentes

Preguntas frecuentes

¿Cómo dimensiono una leaf-spine fabric para un clúster de GPU?
En una fabric leaf-spine no bloqueante de dos niveles, cada conmutador leaf dedica la mitad de sus puertos a las GPU y la otra mitad a los enlaces ascendentes hacia los spine. El número de conmutadores leaf es el recuento de GPU dividido entre los puertos orientados a GPU por leaf, y el número de conmutadores spine es el mínimo necesario para transportar cada enlace ascendente de los leaf sin sobresuscripción. Un clúster de un solo leaf no requiere nivel spine. Esta herramienta calcula dichas cifras para Broadcom Tomahawk 4 y Tomahawk 5 a 400G u 800G.
¿Qué es una topología rail-optimized?
Rail-optimized significa que cada servidor GPU dispone de varias NIC (normalmente 8, una por rail) y que cada rail se conecta a su propio leaf; de este modo, las GPU del mismo índice en distintos servidores confluyen en el mismo leaf y el tráfico AllReduce dominante permanece local. Se trata de una disciplina de cableado y localidad del tráfico superpuesta a una fabric 1:1 no bloqueante. Modifica por dónde fluye el tráfico, no el número de conmutadores leaf y spine.
¿Cuántos transceptores necesita una AI fabric?
Cada enlace fabric punto a punto utiliza dos transceptores, uno en cada extremo, por lo que el número de transceptores es el número de enlaces leaf-to-spine multiplicado por dos. El número de enlaces equivale al número de leaves multiplicado por sus uplinks, que a su vez equivale al número de spines multiplicado por sus downlinks. Esta herramienta indica esas cantidades. Son únicamente cifras de planificación, no una lista de materiales ni un presupuesto.
¿Qué es mejor para la IA, RoCEv2 o InfiniBand?
Ninguno es superior en todos los casos. InfiniBand destaca por su rendimiento bruto con un esfuerzo de ajuste reducido y ofrece un único gestor de fabric. Ethernet con RoCEv2 iguala ese rendimiento una vez ajustado y, por lo general, se impone en coste, apertura, multitenencia y tendencia del sector. El fabric adecuado depende del tamaño del clúster, la dotación de personal y la pila existente. Esta herramienta pondera los factores según sus parámetros y remite después la decisión a una revisión de diseño.
¿Cómo se logra que una AI fabric sea sin pérdidas para RoCEv2?
El RoCEv2 lossless se compone de tres mecanismos que actúan de forma conjunta: PFC para una clase sin descartes, ECN para la señalización temprana de congestión y ETS para el aislamiento de clases. El DCQCN, que combina ECN y PFC, es el control principal en régimen estable, mientras que el PFC actúa como último recurso; por ello, conviene ajustar el umbral de marcado ECN por debajo del umbral PFC. Mantenga PFC, ECN y CoS coherentes de extremo a extremo. OcNOS-DC admite estos mecanismos en las plataformas Tomahawk AI.
¿Se ejecuta la misma imagen de OcNOS en cada conmutador de la fabric?
Sí. Cada conmutador leaf y spine ejecuta una única imagen de OcNOS-DC con RoCEv2, PFC y ECN, y equilibrado de carga dinámico, sobre hardware Tomahawk abierto. De este modo, la fabric se mantiene sobre un solo sistema operativo y un solo contrato de soporte, con independencia del número de conmutadores que genere el diseño.
Fabric de IA

Diseñe toda la fabric de IA con OcNOS

Desde el caso de negocio hasta los cálculos de recuento de puertos, retome donde esté en la construcción.