BCM56990 · TSMC 7 nm · 25.6 Tbps · 64×400G

Broadcom Tomahawk 4 Commutateur Tomahawk 4 25.6 Tbps · 64 × 400G · la génération 400G rentable.

Une plateforme ouverte validée sur OcNOS-DC : Edgecore AS9736-64D. Tomahawk 4 est le palier 400G rentable : 25.6 Tbps de 64×400G en 7nm, avec la même architecture shared-buffer à faible latence et le même ensemble de fonctions OcNOS-DC que le spine TH5 800G, à l'économie du 400G.

25.6Tbps
Capacité du switch
64×400G
Radix de ports natif
~114MB
Shared Buffer
7nm
Procédé TSMC N7
50GPAM4
SerDes par voie
01
Le switch
Matériel ouvert sous Tomahawk 4

Une plateforme. Un objectif : du 400G rentable.

Edgecore AS9736-64D : un switch 2RU 64×400G QSFP-DD sur le BCM56990 Tomahawk 4. ONIE préchargé, exécute la même image OcNOS-DC que les spines TH5 et les leaves TD4. Une plateforme validée : le palier 64×400G du portfolio OcNOS-DC, sous le spine TH5 800G.

Edgecore· famille de plateformes DCS520
AI fabric 400G · DCI

AS9736-64D

Validé sur OcNOS-DC · ONIE préchargé
Ports
64 × QSFP-DD (400G)Breakout: 2×200 / 4×100 / 2×50 (up to 256 logical ports)
Form
2RU · 21.5 kg
Power
~2100 W typique · alimentation AC redondante hot-swap~33 W par cage QSFP-DD
CPU
Intel Xeon classe D · 32 GB RAM
▌ À choisir lorsque

AI fabric 400G pour clusters GPU single-pod sur NICs 400G, et rôles d'agrégation / DCI 400G, où 25.6T de 64×400G au coût du merchant-silicon fait le travail sans payer pour des ports 800G.

Vous êtes ici · 25,6 Tbps

Tomahawk 4 : 64 × 400G

À choisir quand les NICs 400G ancrent le cluster et que le coût par port compte : 25.6 Tbps de 64×400G avec l'ensemble complet des fonctions OcNOS-DC, sous le prix du silicium 800G.

Passez à la vitesse supérieure · 51.2 Tbps

Tomahawk 5 : 64 × 800G

À choisir lorsque le cluster a besoin de ports 800G nativement, ou lorsque le 800G par port à la même densité de 64 ports justifie le surcoût par port. Page Tomahawk 5 →

Boîtier plus compact · 12,8 Tbps

Trident 4 : DC leaf

À privilégier lorsque le rôle est leaf DC en 100G/400G avec une enveloppe de capacité plus réduite. Famille de puces différente, même image OcNOS-DC, coût par port bien inférieur. (Page Trident 4 à venir.)

02
Au cœur du silicium
Ce que Tomahawk 4 apporte à une fabric 400G

Tomahawk 4 : le switch chip 25.6T rentable.

Tomahawk 4 (BCM56990) est un switch 25.6 Tbps en TSMC 7nm avec un radix natif 64×400G. Comme TH3 et TH5, il utilise une architecture on-die shared-buffer de la classe des quelques centaines de mégaoctets, optimisée pour le RoCEv2 lossless. C'est un switch chip à faible latence, pas un router chip deep-buffer : pour un buffering à l'échelle du GB vous vous tournerez vers un composant Jericho ou Qumran StrataDNX, mais pour une fabric AI ou DC 400G le shared buffer et le DLB sont exactement le bon outil.

Pourquoi c'est important : le RoCEv2 lossless repose sur PFC + ECN + DCQCN pour garder les files courtes, et sur DLB pour répartir les elephant flows afin qu'aucune file ne se remplisse. TH4 exécute tout cela dans l'ASIC à 400G, le même ensemble d'outils de contrôle de congestion qu'OcNOS-DC fournit sur le spine TH5 800G. Une fabric TH4 et une fabric TH5 se comportent de la même façon ; la différence tient à la vitesse de port et au coût, pas au comportement lossless.

Spécifications recoupées avec celles de Broadcom Page produit BCM56990 Tomahawk 4 et la matrice de fonctionnalités OcNOS en direct.

ProcessTSMC N7 SeriesStrataXGS BufferOn-die shared RoutageCognitif · DLB ShippingDepuis 2020
Radix de ports Broadcom Tomahawk 4 (BCM56990) représenté comme une grille de 64 ports, chacun 400G, totalisant 25.6 Tbps
À quoi ressemble le 64 x 400G : 512 lanes de 50G PAM4 totalisant 25.6 Tbps sur le die BCM56990.
Quatre choix de conception qui comptent

Pourquoi le TH4 reste pertinent dans la conversation fabric IA même après l'arrivée du TH5.

Du 400G à l'économie du merchant-silicon, avec la même surface fonctionnelle et la même architecture shared-buffer à faible latence que le TH5 800G.

PRINCIPE 02

SerDes 50G PAM4 : 512 voies.

TH3 atteignait 12.8T avec 256 lanes de 50G PAM4 ; TH4 double à 512 lanes au même 50G PAM4 pour 25.6T ; TH5 conserve 512 lanes et passe au 100G PAM4. Huit lanes par cage QSFP-DD donnent du 400G natif ; le breakout s'étend à 200G/100G/50G pour les déploiements à vitesses mixtes.

512 lanes · 50G PAM4
PRINCIPE 03

Routage adaptatif matériel.

Broadcom Cognitive Routing : équilibrage de charge sensible aux flowlets dans l'ASIC, sans aller-retour vers un contrôleur. OcNOS-DC l'active sous le nom de DLB Reactive-Path Rebalance, répartissant les elephant flows à travers la fabric afin qu'aucune file ne se remplisse sous le trafic collectif RoCEv2.

DLB · réaffectation des flowlets
PRINCIPE 04

Silicon mature en 7 nm.

Livré en volume depuis 2020 : plus de quatre ans de corrections de bugs, un comportement prévisible et une enveloppe thermique connue. Pour une mise à niveau en brownfield d'un fabric TH3, c'est le choix sans surprise et prévisible.

TSMC N7 · livré depuis 4+ ans
03
Saut de génération
Tomahawk 3 → Tomahawk 4

Capacité doublée. Radix doublé. Procédé réduit.

TH3 (12.8 Tbps · 32×400G · 16 nm · 50G PAM4) était le cheval de bataille de l'ère pré-AI-fabric. TH4 a doublé la capacité et le radix de ports sur une réduction de procédé de deux nœuds, à l'économie du 400G.

Capacité de commutation
12,8 Tbps 25,6 Tbps

Doublé sur la même empreinte de rack. 2RU est resté 2RU.

Radix de ports natif
32 × 400G 64 × 400G

Deux fois plus de ports à la même vitesse : s'intègre aux conceptions Clos sans niveau supplémentaire.

Nœud de processus
16 nm 7 nm

Réduction en deux étapes. Marge de puissance par port pour les optiques 400G sans refroidissement actif par port.

SerDes lanes
256 lanes 512 lanes

Même 50G PAM4 par lane, deux fois plus de lanes (256 → 512). C'est de là que vient le doublement de capacité.

Le prochain saut : TH5 double à nouveau pour atteindre 51.2 Tbps et 64 × 800G avec des SerDes 100G PAM4. TH4 reste le palier 400G rentable pour les clusters qui n'ont pas encore besoin de ports 800G. Page Tomahawk 5 →
04
Ce que livre OcNOS-DC
OcNOS-DC sur ce silicon

Même image que le spine TH5. Même ensemble d'outils de fabric lossless.

OcNOS-DC s'exécute de façon identique sur les plateformes TH3, TH4 et TH5 : la même fabric RoCEv2 lossless (PFC + ECN + DCQCN), le routage adaptatif DLB et la télémétrie en streaming. Une fabric TH4 400G et une fabric TH5 800G se configurent et s'exploitent de la même manière ; seule la vitesse de port change.

RoCEv2 lossless · shared-buffer

PFC + ECN pre-tuned to xCCL, and the shared buffer absorbs the rest.

PFC + ETS + Dynamic ECN standard avec des profils de buffer DCQCN optimisés pour les collectives RDMA. DLB maintient les elephant flows répartis pour que les files restent courtes, et le watchdog anti-deadlock PFC protège contre les pause storms. L'ensemble complet d'outils lossless qu'OcNOS-DC fournit sur TH5, à 400G.

Routage adaptatif

Le DLB réassocie les flowlets dans l'ASIC.

Cognitive Routing sur TH4 exécute le même DLB Reactive-Path Rebalance qu'OcNOS-DC fournit sur TH5 : le rebinding de flowlets résout les collisions de hash ECMP dans l'ASIC, sans aller-retour vers un contrôleur.

Watchdog d'interblocage PFC

Par port, par priorité. Purge automatique.

Détecte les cycles de files en pause avant qu'ils ne bloquent les jobs d'entraînement, et les draine automatiquement pour qu'une pause storm PFC ne puisse pas stopper une collective.

Télémétrie en streaming

Buffer et congestion sur le fil.

gNMI on-change pour la profondeur de buffer, les marques ECN et les compteurs de pause PFC. Visibilité complète de la congestion, pas une boîte noire.

Réseau réel

BGP · OSPF · IS-IS · EVPN-VXLAN.

Pile Layer 3 complète de niveau opérateur sur le même silicon. Le spine TH4 est aussi un véritable routeur : exploitez-le comme le reste de votre réseau, et non comme une boîte noire.

Surface de fonctionnalités validée

La même image OcNOS-DC que le TH5 : chaque fonctionnalité s'active là où le silicon le permet.

Routage Layer 3 · L1/L2 · primitives AI fabric · Multicast · QoS · Sécurité · Hardware · Management. Validation par plateforme visible sur la matrice publique.

RoCEv2 / PFC DCQCN DLB EVPN-VXLAN BGP / OSPF / IS-IS gNMI / NETCONF ZTP buffer telemetry
Day-0 à Day-2

ZTP. gNMI on-change. NETCONF + YANG. DCBX.

Mettez en service l'AS9736-64D dans le rack avec le zero-touch provisioning. Diffusez chaque compteur, y compris l'état du buffer et de PFC/ECN, vers votre stack d'observabilité. Réglez chaque seuil via une config modélisée en YANG. Pas de scripts de glue.

ZTP IPv4/IPv6 gNMI NETCONF OpenConfig YANG DCBX LLDP Ansible Provider Terraform
Qui construit cette stack

Trois profils opérateurs. Un seul silicon pour les trois.

Le radix 64×400G à l'économie du 400G place l'AS9736-64D dans trois conversations différentes : AI fabric, DCI et modernisation brownfield. Même switch, formulation différente de la même question architecturale.

AI Cluster Operator · pod 400G NIC

Fabric de NIC 400G sans payer pour du silicon 800G.

"Notre cluster est sur des NICs 400G. Nous n'avons pas encore besoin de ports 800G, et nous ne payons pas le premium 800G pour des ports que nous ne pouvons pas utiliser."

Spines TH4 sur AS9736-64D, RoCEv2 lossless avec DCQCN optimisé pour les collectives RDMA, rebinding DLB sub-milliseconde. Clos à trois niveaux pour le scale-out multi-pod, même image OcNOS-DC que le déploiement TH5 voisin.

DC · 400G Spine
DCI · Aggregation Architect

400G DCI transport without a chassis-router bill.

"Our cross-DC links need 400G aggregation and EVPN transport at a sane price. Chassis routers cost ten times what this should."

64×400G at merchant-silicon cost, EVPN-VXLAN inter-DC, full L3 stack, per-tenant gNMI telemetry. Open hardware for 400G DCI transport without the 800G price. Where the design must absorb sustained deep-buffer congestion, that is a StrataDNX Jericho job, not TH4.

DC · DCI · Agrégation
Brownfield · renouvellement TH3

Capacité doublée, même modèle opérationnel.

« Nous avons une fabric TH3 en production. Il nous faut davantage de capacité, mais nous ne voulons pas reconcevoir la couche NOS ni reformer l'équipe réseau. »

La même image OcNOS-DC tourne sur TH3 et TH4. La modernisation brownfield conserve intacts les configs, l'automatisation et les pipelines gNMI. La capacité double. Le modèle d'exploitation reste.

DC · Renouvellement
Questions fréquentes

Questions posées par les architectes

Une seule plateforme : la Edgecore AS9736-64D, un switch 2RU 64×400G QSFP-DD construit sur le Broadcom BCM56990 (Tomahawk 4, 25.6 Tbps). Livré avec ONIE préchargé, exécute la même image OcNOS-DC que les spines TH5 et les leaves TD4. C'est le cheval de bataille 64×400G du portfolio OcNOS-DC.
Le coût. À l'échelle single-pod sur des NICs GPU 400G, une fabric TH4 est moins chère par port que TH5 sans compromis architectural : 25.6 Tbps de 64×400G, la surface fonctionnelle complète d'OcNOS-DC et la même architecture shared-buffer à faible latence que TH5. Le Clos à trois niveaux tient toujours. Vous passez à TH5 (800G) uniquement quand des ports 800G sont sur la BoM, ou que vous voulez diviser par deux le câblage spine-leaf pour la même bande passante agrégée.
Tomahawk 4 is a shared-buffer, faible latence switch chip, pas un router chip deep-buffer. Son packet buffer on-die est de la classe des quelques centaines de mégaoctets, la même architecture que TH3 et TH5, dimensionné pour le RoCEv2 lossless avec PFC + ECN + DCQCN. Pour un deep buffering à l'échelle du GB (rétention DCI long-haul, fort fan-in N:1), il vous faut un router chip Jericho ou Qumran StrataDNX. Pour une fabric AI ou DC 400G à faible latence, le shared buffer de TH4 plus le routage adaptatif DLB est le bon outil.
Choisissez TH5 (AIS800-64D) quand des ports 800G sont sur la BoM, ou que vous voulez du 800G par port au même radix de 64 ports (divise par deux le câblage spine-leaf pour la même bande passante agrégée). Choisissez TH4 (AS9736-64D) quand les NICs 400G sont l'ancre du cluster et que le budget par port exclut le silicium 800G. Les deux exécutent la même image OcNOS-DC. Les mélanger dans une fabric multi-niveaux est un déploiement pris en charge.
Yes. TH4 has the same Cognitive Routing primitives as TH5: flowlet-aware load-balancing in the ASIC, no controller round-trip. OcNOS-DC turns this on as DLB Reactive-Path Rebalance, so a TH4 fabric resolves elephant-flow hash collisions in hardware. PFC deadlock detection & recovery, DCQCN, and ETS are all available.
Capacité doublée deux fois (12.8 → 25.6 → 51.2 Tbps). Procédé réduit deux fois (16 → 7 → 5 nm). Le nombre de lanes a doublé de TH3 à TH4 (256 → 512 lanes) en 50G PAM4, puis TH5 a conservé 512 lanes et doublé le débit par lane à 100G PAM4. Les trois utilisent une architecture shared-buffer. OcNOS-DC prend en charge les trois avec la même image : la modernisation brownfield garde les configs et les pipelines gNMI intacts.
Le radix 64×400G est surdimensionné pour un edge SP sous 1 Tbps ou une passerelle cell-site : choisissez Qumran (Q2A/Q2U/Q2C) pour cela. Pour du pur DC leaf en 100G/25G, ce n'est pas non plus la bonne forme : choisissez Trident 4 (TD4) à 12.8 Tbps. Et si le cluster a réellement besoin de ports 800G aujourd'hui, TH4 impose un niveau Clos supplémentaire, donc choisissez TH5. Le point idéal de TH4 est "400G suffit, et le coût par port compte."

Vous concevez une fabric 400G ? Dimensionnons-la ensemble.

Session d'architecture de 30 minutes avec un architecte réseau OcNOS. Apportez votre nombre de GPU, la vitesse de vos NIC et vos attentes en matière de patterns de rafales, et repartez avec une BoM dimensionnée autour de l'AS9736-64D et un plan de placement face aux alternatives TH5 / TD4.