BCM56990 · TSMC 7 nm · 25.6 Tbps · 64×400G

Broadcom Tomahawk 4 Tomahawk 4 Switch 25.6 Tbps · 64 × 400G · die kosteneffiziente 400G-Generation.

Eine offene Plattform, validiert auf OcNOS-DC: Edgecore AS9736-64D. Tomahawk 4 ist die kosteneffiziente 400G-Klasse: 25.6 Tbps über 64×400G auf 7nm, mit derselben Low-Latency-Shared-Buffer-Architektur und demselben OcNOS-DC-Funktionsumfang wie die TH5 800G Spine, zu 400G-Konditionen.

25.6Tbps
Switch-Kapazität
64×400G
Native Port Radix
~114MB
Shared Buffer
7nm
TSMC-N7-Prozess
50GPAM4
SerDes pro Lane
01
Der Switch
Open Hardware mit Tomahawk 4

Eine Plattform. Ein Zweck: kosteneffizientes 400G.

Edgecore AS9736-64D: ein 2RU 64×400G QSFP-DD Switch auf dem BCM56990 Tomahawk 4. ONIE vorinstalliert, betreibt dasselbe OcNOS-DC-Image wie die TH5 Spines und TD4 Leaves. Eine validierte Plattform: die 64×400G-Klasse des OcNOS-DC-Portfolios, unterhalb der TH5 800G Spine.

Edgecore· DCS520 Plattformfamilie
400G AI Fabric · DCI

AS9736-64D

Validiert auf OcNOS-DC · ONIE vorinstalliert
Ports
64 × QSFP-DD (400G)Breakout: 2×200 / 4×100 / 2×50 (up to 256 logical ports)
Form
2RU · 21.5 kg
Power
~2100 W typisch · hot-swap-redundantes AC~33 W pro QSFP-DD-Cage
CPU
Intel Xeon D-Klasse · 32 GB RAM
▌ Wählen Sie dies, wenn

400G AI Fabric für Single-Pod-GPU-Cluster mit 400G NICs sowie 400G-Aggregations- und DCI-Rollen, bei denen 25.6T über 64×400G zu Merchant-Silicon-Kosten die Aufgabe erledigen, ohne für 800G-Ports zu zahlen.

Sie sind hier · 25,6 Tbps

Tomahawk 4: 64 × 400G

Zu wählen, wenn 400G NICs den Cluster verankern und die Kosten pro Port zählen: 25.6 Tbps über 64×400G mit dem vollen OcNOS-DC-Funktionsumfang, unterhalb des Preises von 800G-Silicon.

Hochskalieren · 51,2 Tbps

Tomahawk 5: 64 × 800G

Wählen Sie diese Variante, wenn der Cluster nativ 800G-Ports benötigt oder wenn 800G pro Port bei derselben 64-Port-Radix den Aufpreis pro Port wert ist. Tomahawk 5 Seite →

Kleinere Box · 12,8 Tbps

Trident 4: DC leaf

Wählen Sie diese Option, wenn die Rolle DC-Leaf bei 100G/400G mit kleinerem Kapazitätsrahmen ist. Andere Chip-Familie, dasselbe OcNOS-DC-Image, deutlich günstiger pro Port. (Trident 4 Seite folgt.)

02
Im Inneren des Silicon
Was Tomahawk 4 einer 400G Fabric bietet

Tomahawk 4: der kosteneffiziente 25.6T Switch-Chip.

Tomahawk 4 (BCM56990) ist ein 25.6 Tbps Switch auf TSMC 7nm mit einer nativen 64×400G-Radix. Wie TH3 und TH5 nutzt er einen On-Die shared-buffer Architektur in der Klasse von wenigen hundert Megabytes, abgestimmt auf verlustfreies RoCEv2. Es ist ein Low-Latency-Switch-Chip, kein Deep-Buffer-Router-Chip: für Pufferung im GB-Bereich greift man zu einem Jericho- oder Qumran-StrataDNX-Baustein, aber für eine 400G AI- oder DC-Fabric ist der Shared Buffer plus DLB genau das richtige Werkzeug.

Warum das zählt: verlustfreies RoCEv2 setzt darauf, dass PFC + ECN + DCQCN die Queues flach halten und DLB Elephant Flows verteilt, sodass keine einzelne Queue anwächst. TH4 führt all dies im ASIC bei 400G aus, dasselbe Congestion-Control-Toolset, das OcNOS-DC auf der TH5 800G Spine ausliefert. Eine TH4 Fabric und eine TH5 Fabric verhalten sich gleich; der Unterschied liegt in Portgeschwindigkeit und Kosten, nicht im verlustfreien Verhalten.

Spezifikationen gegen die von Broadcom gegengeprüft BCM56990 Tomahawk 4 Produktseite und die aktuelle OcNOS-Feature-Matrix.

ProzessTSMC N7 SeriesStrataXGS PufferOn-die shared RoutingCognitive · DLB ShippingSeit 2020
Broadcom Tomahawk 4 (BCM56990) Port-Radix dargestellt als Raster aus 64 Ports, jeder 400G, insgesamt 25.6 Tbps
So sieht 64 x 400G aus: 512 Lanes mit 50G PAM4, insgesamt 25.6 Tbps auf dem BCM56990 Die.
Vier entscheidende Designentscheidungen

Warum TH4 auch nach dem Marktstart von TH5 im AI-Fabric-Gespräch bleibt.

400G zu Merchant-Silicon-Konditionen, mit derselben Funktionsfläche und Low-Latency-Shared-Buffer-Architektur wie das 800G TH5.

PRINZIP 02

50G-PAM4-SerDes: 512 Lanes.

TH3 erreichte 12.8T mit 256 Lanes bei 50G PAM4; TH4 verdoppelt auf 512 Lanes bei denselben 50G PAM4 für 25.6T; TH5 behält 512 Lanes und wechselt zu 100G PAM4. Acht Lanes pro QSFP-DD Cage ergeben natives 400G; Breakout erweitert auf 200G/100G/50G für Deployments mit gemischten Geschwindigkeiten.

512 Lanes · 50G PAM4
PRINZIP 03

Hardwarebasiertes adaptives Routing.

Broadcom Cognitive Routing: Flowlet-bewusstes Load-Balancing im ASIC, kein Controller-Round-Trip. OcNOS-DC aktiviert dies als DLB Reactive-Path Rebalance und verteilt Elephant Flows über die Fabric, sodass unter RoCEv2-Collective-Traffic keine einzelne Queue anwächst.

DLB · Flowlet-Rebinding
PRINZIP 04

Ausgereiftes 7-nm-Silizium.

Seit 2020 in Stückzahlen ausgeliefert: über vier Jahre Bugfixes, vorhersehbares Verhalten und ein bekanntes thermisches Profil. Für den Brownfield-Refresh einer TH3-Fabric ist dies die unaufgeregte und berechenbare Wahl.

TSMC N7 · 4+ Jahre im Versand
03
Generationssprung
Tomahawk 3 → Tomahawk 4

Kapazität verdoppelt. Radix verdoppelt. Prozess verkleinert.

TH3 (12.8 Tbps · 32×400G · 16 nm · 50G PAM4) war das Arbeitspferd der Ära vor der AI Fabric. TH4 verdoppelte die Kapazität und die Port-Radix bei einem Zwei-Knoten-Prozesssprung, zu 400G-Konditionen.

Switching-Kapazität
12.8 Tbps 25.6 Tbps

Verdoppelt bei gleichem Rack-Footprint. 2RU blieb 2RU.

Native Port Radix
32 × 400G 64 × 400G

Doppelt so viele Ports bei gleicher Geschwindigkeit: passt in Clos-Designs ohne zusätzliche Ebene.

Prozessknoten
16 nm 7 nm

Schrumpfung in zwei Schritten. Leistungsreserve pro Port für 400G-Optik ohne aktive Kühlung pro Port.

SerDes lanes
256 lanes 512 lanes

Dieselben 50G PAM4 pro Lane, doppelt so viele Lanes (256 → 512). Daher kam die Verdopplung der Kapazität.

Der nächste Sprung: TH5 verdoppelt erneut auf 51.2 Tbps und 64 × 800G mit 100G PAM4 SerDes. TH4 bleibt die kosteneffiziente 400G-Klasse für Cluster, die noch keine 800G-Ports benötigen. Tomahawk 5 Seite →
04
Was OcNOS-DC mitbringt
OcNOS-DC auf diesem Silicon

Dasselbe Image wie die TH5 Spine. Dasselbe Lossless-Fabric-Toolset.

OcNOS-DC läuft identisch über TH3-, TH4- und TH5-Plattformen: dieselbe verlustfreie RoCEv2 Fabric (PFC + ECN + DCQCN), DLB Adaptive Routing und Streaming-Telemetrie. Eine TH4 400G Fabric und eine TH5 800G Fabric werden auf dieselbe Weise konfiguriert und betrieben; nur die Portgeschwindigkeit ändert sich.

Verlustfreies RoCEv2 · Shared-Buffer

PFC + ECN pre-tuned to xCCL, and the shared buffer absorbs the rest.

Standard PFC + ETS + Dynamic ECN mit DCQCN-Pufferprofilen, abgestimmt auf RDMA-Collectives. DLB hält Elephant Flows verteilt, sodass Queues flach bleiben, und der PFC Deadlock Watchdog schützt vor Pause Storms. Das volle Lossless-Toolset, das OcNOS-DC auf TH5 ausliefert, bei 400G.

Adaptive Routing

DLB bindet Flowlets im ASIC neu zu.

Cognitive Routing auf TH4 führt dasselbe DLB Reactive-Path Rebalance aus, das OcNOS-DC auf TH5 ausliefert: Flowlet-Rebinding löst ECMP-Hash-Kollisionen im ASIC, kein Controller-Round-Trip.

PFC Deadlock Watchdog

Pro Port, pro Priorität. Auto-Drain.

Erkennt Paused-Queue-Zyklen, bevor sie Training-Jobs blockieren, und leert sie automatisch, sodass ein PFC Pause Storm ein Collective nicht zum Stillstand bringen kann.

Streaming-Telemetrie

Buffer und Congestion auf der Leitung.

gNMI On-Change für Puffertiefe, ECN Marks und PFC Pause Counts. Volle Congestion-Sichtbarkeit, keine Blackbox.

Reales Netz

BGP · OSPF · IS-IS · EVPN-VXLAN.

Vollständiger Carrier-Grade-Layer-3-Stack auf demselben Silicon. Der TH4-Spine ist auch ein echter Router: Betreiben Sie ihn wie den Rest Ihres Netzwerks, nicht wie eine Blackbox.

Validierter Funktionsumfang

Dasselbe OcNOS-DC-Image wie TH5: Jede Funktion wird dort aktiviert, wo das Silicon es unterstützt.

Layer-3-Routing · L1/L2 · AI-Fabric-Primitive · Multicast · QoS · Security · Hardware · Management. Validierung pro Plattform sichtbar in der öffentlichen Matrix.

RoCEv2 / PFC DCQCN DLB EVPN-VXLAN BGP / OSPF / IS-IS gNMI / NETCONF ZTP buffer telemetry
Day-0 bis Day-2

ZTP. gNMI on-change. NETCONF + YANG. DCBX.

Bringen Sie den AS9736-64D im Rack per Zero-Touch-Provisioning in Betrieb. Streamen Sie jeden Counter, einschließlich Buffer- und PFC/ECN-Status, an Ihren Observability-Stack. Justieren Sie jeden Schwellenwert über YANG-modellierte Konfiguration. Keine Glue-Skripte.

ZTP IPv4/IPv6 gNMI NETCONF OpenConfig YANG DCBX LLDP Ansible Terraform-Provider
Wer baut diesen Stack

Drei Betreiberprofile. Ein Silicon für alle drei.

Die 64×400G-Radix zu 400G-Konditionen bringt den AS9736-64D in drei verschiedene Gespräche: AI Fabric, DCI und Brownfield-Refresh. Derselbe Switch, andere Rahmung derselben architektonischen Frage.

AI Cluster Operator · 400G-NIC-Pod

400G-NIC-Fabric, ohne für 800G-Silicon zu bezahlen.

"Unser Cluster läuft auf 400G NICs. Wir brauchen noch keine 800G-Ports und zahlen nicht den 800G-Aufpreis für Ports, die wir nicht nutzen können."

TH4 Spines auf AS9736-64D, verlustfreies RoCEv2 mit DCQCN abgestimmt auf RDMA-Collectives, DLB-Rebinding im Sub-Millisekunden-Bereich. Three-Tier Clos für Multi-Pod-Scale-out, dasselbe OcNOS-DC-Image wie beim benachbarten TH5-Deployment.

DC · 400G Spine
DCI · Aggregation Architect

400G DCI transport without a chassis-router bill.

"Our cross-DC links need 400G aggregation and EVPN transport at a sane price. Chassis routers cost ten times what this should."

64×400G at merchant-silicon cost, EVPN-VXLAN inter-DC, full L3 stack, per-tenant gNMI telemetry. Open hardware for 400G DCI transport without the 800G price. Where the design must absorb sustained deep-buffer congestion, that is a StrataDNX Jericho job, not TH4.

DC · DCI · Aggregation
Brownfield · TH3-Refresh

Doppelte Kapazität, dasselbe Betriebsmodell.

"Wir haben eine TH3-Fabric in Produktion. Wir brauchen mehr Kapazität, wollen aber weder die NOS-Schicht neu designen noch das Netzwerk-Team neu schulen."

Dasselbe OcNOS-DC-Image läuft auf TH3 und TH4. Ein Brownfield-Refresh hält Configs, Automation und gNMI-Pipelines intakt. Die Kapazität verdoppelt sich. Das Betriebsmodell bleibt.

DC · Modernisierung
Häufig gestellt

Fragen, die Architekten stellen

Eine Plattform: die Edgecore AS9736-64D, ein 2RU 64×400G QSFP-DD Switch auf Basis des Broadcom BCM56990 (Tomahawk 4, 25.6 Tbps). Wird ONIE-vorinstalliert ausgeliefert, betreibt dasselbe OcNOS-DC-Image wie die TH5 Spines und die TD4 Leaves. Es ist das 64×400G-Arbeitspferd im OcNOS-DC-Portfolio.
Kosten. Bei Single-Pod-Skalierung auf 400G GPU NICs ist eine TH4 Fabric pro Port günstiger als TH5, ohne architektonischen Kompromiss: 25.6 Tbps über 64×400G, die volle OcNOS-DC-Funktionsfläche und dieselbe Low-Latency-Shared-Buffer-Architektur wie TH5. Three-Tier Clos passt weiterhin. Man steigt nur dann auf TH5 (800G) um, wenn 800G-Ports auf der BoM stehen oder man die Spine-Leaf-Verkabelung bei gleicher aggregierter Bandbreite halbieren möchte.
Tomahawk 4 is a Shared-Buffer, Low-Latency Switch-Chip, kein Deep-Buffer-Router-Chip. Sein On-Die-Paketpuffer liegt in der Klasse von wenigen hundert Megabytes, dieselbe Architektur wie TH3 und TH5, dimensioniert für verlustfreies RoCEv2 mit PFC + ECN + DCQCN. Für Deep Buffering im GB-Bereich (Long-Haul-DCI-Hold, starkes N:1-Fan-in) braucht man einen Jericho- oder Qumran-StrataDNX-Router-Chip. Für eine Low-Latency-400G-AI- oder DC-Fabric ist der Shared Buffer von TH4 plus DLB Adaptive Routing das richtige Werkzeug.
Wählen Sie TH5 (AIS800-64D), wenn 800G-Ports auf der BoM stehen oder Sie 800G pro Port bei derselben 64-Port-Radix wollen (halbiert die Spine-Leaf-Verkabelung bei gleicher aggregierter Bandbreite). Wählen Sie TH4 (AS9736-64D), wenn 400G NICs der Cluster-Anker sind und das Budget pro Port 800G-Silicon ausschließt. Beide betreiben dasselbe OcNOS-DC-Image. Sie in einer Multi-Tier-Fabric zu mischen ist ein unterstütztes Deployment.
Yes. TH4 has the same Cognitive Routing primitives as TH5: flowlet-aware load-balancing in the ASIC, no controller round-trip. OcNOS-DC turns this on as DLB Reactive-Path Rebalance, so a TH4 fabric resolves elephant-flow hash collisions in hardware. PFC deadlock detection & recovery, DCQCN, and ETS are all available.
Kapazität zweimal verdoppelt (12.8 → 25.6 → 51.2 Tbps). Prozess zweimal verkleinert (16 → 7 → 5 nm). Lane-Anzahl von TH3 zu TH4 verdoppelt (256 → 512 Lanes) bei 50G PAM4, dann behielt TH5 512 Lanes und verdoppelte pro Lane auf 100G PAM4. Alle drei nutzen eine Shared-Buffer-Architektur. OcNOS-DC unterstützt alle drei mit demselben Image: Brownfield-Refresh hält Konfigurationen und gNMI-Pipelines intakt.
Die 64×400G-Radix ist überdimensioniert für SP Edge unter 1 Tbps oder Cell-Site-Gateway: wählen Sie dafür Qumran (Q2A/Q2U/Q2C). Für reines DC Leaf bei 100G/25G ist es ebenfalls die falsche Form: wählen Sie Trident 4 (TD4) bei 12.8 Tbps. Und wenn der Cluster heute wirklich 800G-Ports braucht, erzwingt TH4 eine zusätzliche Clos-Ebene, also wählen Sie TH5. Der Sweet Spot von TH4 ist "400G reicht, und die Kosten pro Port zählen."

Planen Sie eine 400G Fabric? Lassen Sie uns sie gemeinsam dimensionieren.

30-minütige Architektur-Session mit einem OcNOS-Netzwerkarchitekten. Bringen Sie Ihre GPU-Anzahl, NIC-Geschwindigkeit und Burst-Pattern-Erwartungen mit und gehen Sie mit einer dimensionierten BoM rund um den AS9736-64D sowie einem Platzierungsplan im Vergleich zu den TH5-/TD4-Alternativen.