BCM56990 · TSMC 7 nm · 25.6 Tbps · 64×400G

Broadcom Tomahawk 4 Switch Tomahawk 4 25.6 Tbps · 64 × 400G · la generación 400G rentable.

Una plataforma abierta validada en OcNOS-DC: Edgecore AS9736-64D. Tomahawk 4 es el nivel 400G rentable: 25.6 Tbps de 64×400G en 7nm, con la misma arquitectura shared-buffer de baja latencia y el mismo conjunto de funciones OcNOS-DC que el spine TH5 800G, con la economía de 400G.

25.6Tbps
Capacidad del switch
64×400G
Radix de puertos nativo
~114MB
Shared Buffer
7nm
Proceso TSMC N7
50GPAM4
SerDes por carril
01
El switch
Hardware abierto que ejecuta Tomahawk 4

Una plataforma. Un propósito: 400G rentable.

Edgecore AS9736-64D: un switch 2RU 64×400G QSFP-DD sobre el BCM56990 Tomahawk 4. ONIE precargado, ejecuta la misma imagen OcNOS-DC que los spines TH5 y los leaves TD4. Una plataforma validada: el nivel 64×400G del portfolio OcNOS-DC, por debajo del spine TH5 800G.

Edgecore· familia de plataformas DCS520
400G AI fabric · DCI

AS9736-64D

Validado en OcNOS-DC · ONIE precargado
Puertos
64 × QSFP-DD (400G)Breakout: 2×200 / 4×100 / 2×50 (up to 256 logical ports)
Form
2RU · 21.5 kg
Power
~2100 W típico · AC redundante de intercambio en caliente~33 W por jaula QSFP-DD
CPU
Intel Xeon D-class · 32 GB RAM
▌ Elija esto cuando

400G AI fabric para clústeres GPU de un solo pod sobre NICs 400G, y roles de agregación 400G / DCI, donde 25.6T de 64×400G a coste de merchant-silicon cumplen la tarea sin pagar por puertos 800G.

Usted está aquí · 25.6 Tbps

Tomahawk 4: 64 × 400G

Elíjalo cuando las NICs 400G anclan el clúster y el coste por puerto importa: 25.6 Tbps de 64×400G con el conjunto completo de funciones OcNOS-DC, por debajo del precio del silicio 800G.

Escale · 51.2 Tbps

Tomahawk 5: 64 × 800G

Elija esta opción cuando el clúster necesite puertos de 800G de forma nativa, o cuando 800G por puerto con el mismo radix de 64 puertos justifique el sobreprecio por puerto. Página de Tomahawk 5 →

Caja más pequeña · 12.8 Tbps

Trident 4: DC leaf

Elíjalo cuando el rol sea leaf de DC a 100G/400G con un envolvente de capacidad menor. Familia de chip distinta, la misma imagen OcNOS-DC, mucho más económico por puerto. (Próximamente la página de Trident 4.)

02
Dentro del silicio
Lo que Tomahawk 4 aporta a un fabric 400G

Tomahawk 4: el switch chip 25.6T rentable.

Tomahawk 4 (BCM56990) es un switch de 25.6 Tbps sobre TSMC 7nm con un radix nativo 64×400G. Como TH3 y TH5, usa una arquitectura on-die shared-buffer de la clase de pocas centenas de megabytes, ajustada para RoCEv2 sin pérdidas. Es un switch chip de baja latencia, no un router chip deep-buffer: para buffering a escala de GB se recurre a una parte Jericho o Qumran StrataDNX, pero para un AI o DC fabric 400G el shared buffer más DLB es exactamente la herramienta adecuada.

Por qué importa: RoCEv2 sin pérdidas depende de que PFC + ECN + DCQCN mantengan las colas poco profundas, y de que DLB reparta los elephant flows para que ninguna cola se acumule. TH4 ejecuta todo esto en el ASIC a 400G, el mismo conjunto de herramientas de control de congestión que OcNOS-DC incluye en el spine TH5 800G. Un fabric TH4 y un fabric TH5 se comportan igual; la diferencia es la velocidad de puerto y el coste, no el aspecto sin pérdidas.

Especificaciones verificadas con las de Broadcom Página de producto BCM56990 Tomahawk 4 y la matriz de funciones de OcNOS en vivo.

ProcessTSMC N7 SeriesStrataXGS BufferOn-die shared EnrutamientoCognitivo · DLB ShippingDesde 2020
Radix de puertos del Broadcom Tomahawk 4 (BCM56990) mostrado como una cuadrícula de 64 puertos, cada uno de 400G, que suman 25.6 Tbps
Qué aspecto tiene 64 x 400G: 512 lanes de 50G PAM4 que suman 25.6 Tbps en el die BCM56990.
Cuatro decisiones de diseño que importan

Por qué el TH4 sigue presente en la conversación sobre AI fabric incluso tras el lanzamiento del TH5.

400G con la economía del merchant-silicon, con la misma superficie de funciones y la misma arquitectura shared-buffer de baja latencia que el TH5 800G.

PRINCIPIO 02

SerDes 50G PAM4: 512 carriles.

TH3 alcanzó 12.8T con 256 lanes de 50G PAM4; TH4 duplica a 512 lanes con el mismo 50G PAM4 para 25.6T; TH5 mantiene 512 lanes y pasa a 100G PAM4. Ocho lanes por jaula QSFP-DD dan 400G nativo; el breakout se extiende a 200G/100G/50G para despliegues de velocidad mixta.

512 carriles · 50G PAM4
PRINCIPIO 03

Enrutamiento adaptativo por hardware.

Broadcom Cognitive Routing: balanceo de carga consciente de flowlets en el ASIC, sin ida y vuelta al controlador. OcNOS-DC lo activa como DLB Reactive-Path Rebalance, repartiendo los elephant flows por el fabric para que ninguna cola se acumule bajo el tráfico colectivo RoCEv2.

DLB · reasignación de flowlets
PRINCIPIO 04

Silicio maduro de 7 nm.

En envíos de gran volumen desde 2020: más de cuatro años de correcciones de errores, comportamiento predecible y una envolvente térmica conocida. Para la renovación brownfield de una fabric TH3, esta es la opción aburrida y predecible.

TSMC N7 · más de 4 años de envíos
03
Salto generacional
Tomahawk 3 → Tomahawk 4

La capacidad se duplicó. El radix se duplicó. El proceso se redujo.

TH3 (12.8 Tbps · 32×400G · 16 nm · 50G PAM4) fue el caballo de batalla de la era previa al AI fabric. TH4 duplicó la capacidad y el radix de puertos con una reducción de proceso de dos nodos, con la economía de 400G.

Capacidad de conmutación
12,8 Tbps 25,6 Tbps

El doble en el mismo espacio de rack. 2RU se mantuvo en 2RU.

Radix de puertos nativo
32 × 400G 64 × 400G

El doble de puertos a la misma velocidad: encaja en diseños Clos sin un nivel adicional.

Nodo de proceso
16 nm 7 nm

Reducción en dos pasos. Margen de potencia por puerto para ópticas de 400G sin refrigeración activa por puerto.

SerDes lanes
256 lanes 512 lanes

El mismo 50G PAM4 por lane, el doble de lanes (256 → 512). De ahí vino la duplicación de la capacidad.

El siguiente salto: TH5 vuelve a duplicar a 51.2 Tbps y 64 × 800G con SerDes 100G PAM4. TH4 se mantiene como el nivel 400G rentable para clústeres que aún no necesitan puertos 800G. Página de Tomahawk 5 →
04
Qué incluye OcNOS-DC
OcNOS-DC en este silicio

La misma imagen que el spine TH5. El mismo conjunto de herramientas lossless-fabric.

OcNOS-DC se ejecuta de forma idéntica en las plataformas TH3, TH4 y TH5: el mismo fabric RoCEv2 sin pérdidas (PFC + ECN + DCQCN), enrutamiento adaptativo DLB y telemetría en streaming. Un fabric TH4 400G y un fabric TH5 800G se configuran y operan de la misma manera; solo cambia la velocidad de puerto.

RoCEv2 sin pérdidas · shared-buffer

PFC + ECN pre-tuned to xCCL, and the shared buffer absorbs the rest.

PFC + ETS + Dynamic ECN estándar con perfiles de buffer DCQCN ajustados para colectivos RDMA. DLB mantiene los elephant flows repartidos para que las colas sigan poco profundas, y el watchdog de deadlock PFC protege frente a tormentas de pausa. El conjunto completo de herramientas lossless que OcNOS-DC incluye en TH5, a 400G.

Enrutamiento adaptativo

DLB revincula los flowlets en el ASIC.

Cognitive Routing en TH4 ejecuta el mismo DLB Reactive-Path Rebalance que OcNOS-DC incluye en TH5: el reenlace de flowlets resuelve las colisiones de hash ECMP en el ASIC, sin ida y vuelta al controlador.

Watchdog de bloqueo PFC

Por puerto, por prioridad. Purga automática.

Detecta ciclos de colas en pausa antes de que bloqueen los trabajos de entrenamiento, y los drena automáticamente para que una tormenta de pausa PFC no pueda detener un colectivo.

Telemetría en streaming

Buffer y congestión en el cable.

gNMI on-change para la profundidad de buffer, las marcas ECN y los recuentos de pausa PFC. Visibilidad completa de la congestión, no una caja negra.

Red real

BGP · OSPF · IS-IS · EVPN-VXLAN.

Stack completo de Layer 3 de nivel operador sobre el mismo silicio. El spine TH4 también es un router real: opérelo como el resto de su red, no como una caja negra.

Superficie de funciones validada

La misma imagen de OcNOS-DC que el TH5: cada función se activa allí donde el silicio lo permite.

Enrutamiento Layer 3 · L1/L2 · primitivas de AI fabric · Multicast · QoS · Seguridad · Hardware · Gestión. Validación por plataforma visible en la matriz pública.

RoCEv2 / PFC DCQCN DLB EVPN-VXLAN BGP / OSPF / IS-IS gNMI / NETCONF ZTP buffer telemetry
Del Día 0 al Día 2

ZTP. gNMI on-change. NETCONF + YANG. DCBX.

Ponga en marcha el AS9736-64D en el rack con aprovisionamiento zero-touch. Transmita cada contador, incluido el estado de buffer y PFC/ECN, a su stack de observabilidad. Ajuste cada umbral mediante configuración modelada en YANG. Sin scripts de pegamento.

ZTP IPv4/IPv6 gNMI NETCONF OpenConfig YANG DCBX LLDP Ansible Proveedor de Terraform
Quién construye este stack

Tres perfiles de operador. Un solo silicio para los tres.

El radix 64×400G con la economía de 400G sitúa al AS9736-64D en tres conversaciones distintas: AI fabric, DCI y renovación brownfield. El mismo switch, distinto enfoque de la misma cuestión arquitectónica.

AI Cluster Operator · pod de NIC de 400G

Fabric de NIC de 400G sin pagar por silicio de 800G.

"Nuestro clúster está sobre NICs 400G. Aún no necesitamos puertos 800G, y no vamos a pagar la prima de 800G por puertos que no podemos usar."

Spines TH4 sobre AS9736-64D, RoCEv2 sin pérdidas con DCQCN ajustado para colectivos RDMA, reenlace DLB en menos de un milisegundo. Clos de tres niveles para escalado horizontal multi-pod, la misma imagen OcNOS-DC que el despliegue TH5 contiguo.

DC · 400G Spine
DCI · Aggregation Architect

400G DCI transport without a chassis-router bill.

"Our cross-DC links need 400G aggregation and EVPN transport at a sane price. Chassis routers cost ten times what this should."

64×400G at merchant-silicon cost, EVPN-VXLAN inter-DC, full L3 stack, per-tenant gNMI telemetry. Open hardware for 400G DCI transport without the 800G price. Where the design must absorb sustained deep-buffer congestion, that is a StrataDNX Jericho job, not TH4.

DC · DCI · Agregación
Brownfield · Renovación TH3

El doble de capacidad, el mismo modelo operativo.

"Tenemos un fabric TH3 en producción. Necesitamos más capacidad, pero no queremos rediseñar la capa del NOS ni volver a capacitar al equipo de red."

La misma imagen OcNOS-DC se ejecuta en TH3 y TH4. La renovación brownfield mantiene intactas las configuraciones, la automatización y las canalizaciones gNMI. La capacidad se duplica. El modelo operativo permanece.

DC · Renovación
Preguntas frecuentes

Preguntas que hacen los arquitectos

Una plataforma: la Edgecore AS9736-64D, un switch 2RU 64×400G QSFP-DD construido sobre el Broadcom BCM56990 (Tomahawk 4, 25.6 Tbps). Se entrega con ONIE precargado, ejecuta la misma imagen OcNOS-DC que los spines TH5 y los leaves TD4. Es el caballo de batalla 64×400G del portfolio OcNOS-DC.
Coste. A escala de un solo pod sobre NICs GPU 400G, un fabric TH4 es más barato por puerto que TH5 sin compromiso arquitectónico: 25.6 Tbps de 64×400G, la superficie completa de funciones OcNOS-DC y la misma arquitectura shared-buffer de baja latencia que TH5. Un Clos de tres niveles sigue encajando. Se sube a TH5 (800G) solo cuando hay puertos 800G en el BoM, o cuando se quiere reducir a la mitad el cableado spine-leaf para el mismo ancho de banda agregado.
Tomahawk 4 is a shared-buffer, baja latencia switch chip, no un router chip deep-buffer. Su buffer de paquetes on-die está en la clase de pocas centenas de megabytes, la misma arquitectura que TH3 y TH5, dimensionado para RoCEv2 sin pérdidas con PFC + ECN + DCQCN. Para deep buffering a escala de GB (retención DCI de larga distancia, fuerte fan-in N:1) conviene un router chip Jericho o Qumran StrataDNX. Para un AI o DC fabric 400G de baja latencia, el shared buffer de TH4 más el enrutamiento adaptativo DLB es la herramienta adecuada.
Elija TH5 (AIS800-64D) cuando haya puertos 800G en el BoM, o cuando quiera 800G por puerto con el mismo radix de 64 puertos (reduce a la mitad el cableado spine-leaf para el mismo ancho de banda agregado). Elija TH4 (AS9736-64D) cuando las NICs 400G sean el ancla del clúster y el presupuesto por puerto descarte el silicio 800G. Ambos ejecutan la misma imagen OcNOS-DC. Mezclarlos en un fabric multinivel es un despliegue soportado.
Yes. TH4 has the same Cognitive Routing primitives as TH5: flowlet-aware load-balancing in the ASIC, no controller round-trip. OcNOS-DC turns this on as DLB Reactive-Path Rebalance, so a TH4 fabric resolves elephant-flow hash collisions in hardware. PFC deadlock detection & recovery, DCQCN, and ETS are all available.
La capacidad se duplicó dos veces (12.8 → 25.6 → 51.2 Tbps). El proceso se redujo dos veces (16 → 7 → 5 nm). El número de lanes se duplicó de TH3 a TH4 (256 → 512 lanes) a 50G PAM4, luego TH5 mantuvo 512 lanes y duplicó por lane a 100G PAM4. Los tres usan una arquitectura shared-buffer. OcNOS-DC soporta los tres con la misma imagen: la renovación brownfield mantiene intactas las configuraciones y los pipelines gNMI.
El radix 64×400G es excesivo para un SP edge de menos de 1 Tbps o un gateway de cell-site: para esos casos elija Qumran (Q2A/Q2U/Q2C). Para un DC leaf puro a 100G/25G también es la forma equivocada: elija Trident 4 (TD4) a 12.8 Tbps. Y si el clúster realmente necesita puertos 800G hoy, TH4 obliga a un nivel Clos adicional, así que elija TH5. El punto ideal de TH4 es "400G es suficiente, y el coste por puerto importa."

¿Diseñando un fabric 400G? Dimensionémoslo juntos.

Sesión de arquitectura de 30 minutos con un arquitecto de red OcNOS. Traiga su cantidad de GPU, la velocidad de las NIC y sus expectativas de patrón de ráfagas, y váyase con una BoM dimensionada en torno al AS9736-64D y un plan de ubicación frente a las alternativas TH5 / TD4.