BCM78900 · TSMC 5 nm · Auslieferung seit März 2023

Broadcom Tomahawk 5 Tomahawk 5 Switches Drei offene 800G-Plattformen, validiert auf OcNOS-DC.

Edgecore AIS800-64D, UfiSpace S9321-64E und S9321-64EO: dasselbe Silizium, dasselbe OcNOS-DC-Image, drei Beschaffungswege. Spezifikationen, Entscheidungsregeln und die OcNOS-DC-Feature-Oberfläche für Ingenieure, die einen Tomahawk-5-Switch auswählen.

51.2Tbps
Switch-Kapazität
64×800G
Native Port Radix
3SKUs
OcNOS-Validated
2ODMs
Edgecore · UfiSpace
5nm
TSMC-N5-Prozess
01
Die Switches
Open Hardware mit Tomahawk 5

Drei 800G-Plattformen. Zwei ODMs. Ein OcNOS-DC-Image.

Two hardware designs, three SKUs. All three ship ONIE pre-loaded and run the same OcNOS-DC image. The differences are form factor (QSFP-DD vs OSFP), branding (AI-fabric SKU vs general-DC SKU), and which optics ecosystem the deployment is built around. Each card links to the full vendor datasheet (PDF, hosted locally).

Edgecore· DCS560 Plattformfamilie
AI Fabric Spine

AIS800-64D

Validiert auf OcNOS-DC · ONIE vorinstalliert
Ports
64 × QSFP-DD800Breakout: 2×400 / 4×200 / 8×100 (320 logische Ports)
Form
2RU
Power
2× 3000 W AC/DC redundant30 W pro QSFP-DD-Cage
CPU
Intel Xeon D1713NTE
▌ Wählen Sie dies, wenn

AI-Fabric für GPU-Cluster. Edgecore-DCS560-Chassis mit dem AI-Fabric-SKU-Framing.

UfiSpace· Plattformfamilie S9321
AI Fabric Spine

S9321-64E

Validiert auf OcNOS-DC · ONIE vorinstalliert
Ports
64 × QSFP-DD (200/400/800G)Breakout: 2×400 / 4×200 / 8×100
Form
2RU · 23.72 kg
Power
913 W typisch (ohne Transceiver)30 W pro QSFP-DD-Cage
CPU
Intel Icelake-D 4-Core · 32 GB DDR4
▌ Wählen Sie dies, wenn

Große, entropiearme AI-Flows. UfiSpace positioniert den 64E für AllReduce-dominierten Verkehr, bei dem das adaptive Routing des TH5 im Zentrum des Designs steht.

UfiSpace· Plattformfamilie S9321
800G DCI · kohärente Optik

S9321-64EO

Validiert auf OcNOS-DC · ONIE vorinstalliert
Ports
64 × OSFP (200/400/800G)Breakout: 2×400 / 4×200 / 8×100
Form
2RU · 23.74 kg
Power
925 W typical · 200-240 V ACOSFP-Cages für leistungsstärkere Optiken
CPU
Intel Icelake-D · 32 GB DDR4
▌ Wählen Sie dies, wenn

800G-ZR/ZR+-Coherent oder andere Modulklassen mit höherer Leistungsaufnahme. OSFP-Formfaktor des 64E: Wählen Sie ihn, wenn die Optik die Cage-Wahl bestimmt.

· How to choose between the three

AIS800 vs. S9321-64EDasselbe TH5-Silizium, zwei ODMs. Edgecore DCS560 (AIS800-64D) vs. UfiSpace S9321 – Dual-Source-BoM für Hyperscale- und NeoCloud-Beschaffung.
QSFP-DD vs OSFPQSFP-DD (S9321-64E and AIS800-64D) for the high-volume optics ecosystem. OSFP (S9321-64EO) for higher-power module classes including 800G ZR/ZR+ coherent.
Edgecore vs UfiSpaceBeide sind Open-Hardware-ODMs mit enger IP-Infusion-Co-Design-Zusammenarbeit. Wählen Sie nach Ihrer ODM-Beziehung, RMA-Logistik oder BoM-Wirtschaftlichkeit.
Single-Vendor-RisikoZwei Anbieter mit TH5-Plattformen bedeuten, dass eine Dual-Source-BoM realistisch ist, was für die Beschaffung im Hyperscale- und NeoCloud-Bereich wichtig ist.
02
Im Inneren des Silicon
Was Ihnen 51,2 Tbps in einem Die bringen

Tomahawk 5: Broadcoms Flaggschiff-Merchant-Switch-ASIC.

The BCM78900 ist ein einzelner monolithischer 5-nm-Die, der 51,2 Tbps Switching-Kapazität liefert und nativ 64 Ports mit 800GbE, 128 mit 400G oder 256 mit 200G speist. Es war Broadcoms erstes 5-nm-Merchant-Switch-IC und das weltweit erste Produkt, das 800GbE am Cage unterstützte. 512 SerDes-Lanes mit 100G PAM4: dieselbe Lane-Anzahl wie Tomahawk 4, die doppelte Geschwindigkeit pro Lane.

Über die reine Kapazität hinaus machten drei architektonische Entscheidungen TH5 zum Silicon unter den meisten produktiven AI-Fabrics: ein Shared-Buffer-Architektur der xCCL-(NCCL / RCCL / oneCCL)-Kollektiv-Microbursts hardwareseitig abfängt Cognitive Routing (DLB), das Elephant Flows im ASIC neu bindet, sowie 5-nm-Thermal-Headroom, der 30-W-QSFP-DD800-Cages ohne aktive Kühlung pro Port betreiben lässt.

Spezifikationen verifizierbar anhand der öffentlichen Broadcom-Angaben BCM78900 Produktseite.

ProzessTSMC N5 SeriesStrataXGS BufferShared, RDMA-optimiert RoutingCognitive · DLB ShippingSeit März 2023
Port-Radix des Broadcom Tomahawk 5 (BCM78900), dargestellt als Raster aus 64 Ports, jeder mit 800G QSFP-DD, mit insgesamt 51,2 Tbps Switching auf einem einzigen Die
So sehen 64 x 800G aus: 512 Lanes mit 100G PAM4, insgesamt 51,2 Tbps auf dem BCM78900 Die.
Vier entscheidende Designentscheidungen

Warum TH5 in nahezu jedem seit 2024 gebauten offenen AI-Fabric gelandet ist.

Die Schlagzahl bekommt die Presse. Diese vier technischen Entscheidungen sind das, was AI-Fabric-Architekten tatsächlich interessiert.

PRINCIPLE 01

Gleiche Lane-Anzahl, doppelte Geschwindigkeit.

TH5 führt dieselben 512 SerDes-Lanes wie TH4 und betreibt sie mit 100G PAM4 statt 50G. Die Verdopplung des Durchsatzes ergab sich durch das Beschleunigen vorhandener Infrastruktur, nicht durch deren Erweiterung.

100G PAM4 · 106 Gbps
PRINCIPLE 02

Shared-Buffer, nicht partitioniert.

Paket-Memory-Pools über alle 64 Ports hinweg, nicht pro Port aufgeteilt. xCCL-AllReduce-Micro-Bursts an einem Port werden vom fabric-weiten Pool absorbiert, statt Tail-Drop auszulösen. Der Einzeiler-Grund, warum TH5 bei RoCEv2 gewinnt.

Shared-buffer · RDMA-tuned
PRINCIPLE 03

Hardwarebasiertes adaptives Routing.

Broadcom Cognitive Routing erkennt überlastete Pfade und rebindet Elephant Flows im ASIC: kein Controller-Round-Trip, kein ECMP-Rehashing. OcNOS-DC aktiviert dies als DLB Reactive-Path Rebalance.

DLB · 64 µs Flowlet
PRINCIPLE 04

5 nm thermische Reserve.

Der erste 5-nm-Merchant-Switch-IC. Erst der Prozess-Shrink machte 30 W pro QSFP-DD800-Cage ohne aktive Kühlung pro Port machbar, einschließlich Hochleistungs-800G-Optik und 8×100G-Breakout.

TSMC N5 · 30 W/port
03
Generationssprung
Tomahawk 4 → Tomahawk 5

Geschwindigkeit pro Port verdoppelt. Kapazität verdoppelt. Dieselbe 64-Port-Radix.

Ehrliche Einordnung: TH4 (25,6 Tbps · 64×400G · 7 nm) ist für Cluster mit 400G-NICs nach wie vor exzellent. TH5 verdient seinen Rack-Platz dann, wenn sowohl 800G pro Port als auch AI-Fabric-Primitives gefragt sind.

Switching-Kapazität
25.6 Tbps 51,2 Tbps

Verdoppelt bei gleichbleibendem Rack-Footprint. Gleiche 2RU, gleiche Leistungsklasse.

Geschwindigkeit pro Port
64 × 400G 64 × 800G

Dieselbe 64-Port-Radix auf den tatsächlichen IPI-Plattformen (AS9736-64D → AIS800-64D / S9321). Die Bandbreite pro Port verdoppelt sich, sodass jede Clos-Stufe doppelt so viel Traffic transportiert.

Prozessknoten
7 nm 5 nm

Erster 5-nm-Merchant-Switch-IC. Thermische Reserve für 30 W/Port ohne aktive Kühlung.

SerDes pro Lane
50G PAM4 100G PAM4

Dieselben 512 Lanes, doppelte Geschwindigkeit. Die Durchsatzverdopplung kam aus der bestehenden Infrastruktur.

Der Brownfield-Refresh bleibt sauber. Dasselbe OcNOS-DC-Image läuft auf TH3-, TH4- und TH5-Plattformen: Konfigurationen, Automatisierung und gNMI-Pipelines werden übernommen. Wählen Sie TH5 für das nächste Cluster und behalten Sie TH4 dort, wo es bereits funktioniert.
04
Was OcNOS-DC mitbringt
OcNOS-DC auf diesem Silicon

Carrier-Grade NOS. KI-optimierte Defaults.

Tomahawk 5 hat die Hardware. Die Aufgabe des NOS ist es, sie zugänglich zu machen: für Operatoren, für Telemetrie-Pipelines, für den Cluster-Scheduler, ohne sie zu CLI-Verrenkungen drumherum zu zwingen. OcNOS-DC liefert diese Primitive als erstklassige konfigurierbare Objekte mit YANG-modelliertem State.

Verlustfreies RoCEv2

Shared-Buffer-Architektur, Zero-Drop East-West.

OcNOS-DC liefert PFC + ETS + Dynamic ECN bereits auf xCCL-Kollektiv-Pattern abgestimmt aus. Die Tail-Latenz bleibt auch unter AllReduce-Micro-Bursts begrenzt, die Community-NOS-Fabrics in die Knie zwingen. Der Shared-Buffer-Pool des TH5 absorbiert synchronisierten Many-to-One-Traffic, der auf Chips mit partitionierten Buffern zu Tail-Drops führen würde.

Adaptive Routing

DLB bindet Flowlets in 64 µs neu.

ECMP-Hash-Kollisionen unter Elephant Flows sind der AI-Fabric-Killer. OcNOS-DC aktiviert das Flowlet-Rebinding von TH5 Cognitive Routing, sodass sich AllReduce-Verkehr automatisch über jeden Spine-Pfad verteilt.

PFC Deadlock Watchdog

Per-port, per-priority. Auto-drain.

Erkennt Paused-Queue-Zyklen, bevor sie Training-Jobs zum Stillstand bringen. Automatische Wiederherstellung ohne Eingriff des Betreibers.

Streaming-Telemetrie

gNMI on-change, OpenConfig YANG.

Buffer-Tiefe, ECN-Marks, PFC-Pause-Zähler: jeder Schwellenwert ein Stellrad, jeder Counter ein Sensor-Pfad. Bindet sich in Prometheus, Grafana und OTel ein.

Reales Netz

BGP · OSPF · IS-IS · EVPN-VXLAN.

Der TH5-Spine ist außerdem ein echter Router. Vollständiger Carrier-Grade-Layer-3-Stack auf demselben Silicon: Betreiben Sie das AI-Fabric wie den Rest Ihres Netzwerks, nicht wie eine Black Box.

Validierter Funktionsumfang

215 Features in 8 Kategorien, entnommen aus der aktuellen OcNOS Feature Matrix.

Layer 3 routing · L1/L2 · AI fabric primitives · Multicast · QoS · Security · Hardware · Management. Every entry verifiable per-platform on the public matrix.

RoCEv2 / PFC DCQCN DLB EVPN-VXLAN SR-MPLS BGP / OSPF / IS-IS gNMI / NETCONF ZTP UEC 1.0-fähig
Day-0 to Day-2

ZTP. gNMI on-change. NETCONF + YANG. DCBX.

Bringen Sie einen TH5-Spine im Rack per Zero-Touch-Provisioning hoch. Streamen Sie jeden Counter in Ihren Observability-Stack. Justieren Sie jeden Schwellenwert über YANG-modellierte Config. Keine Glue-Skripte.

ZTP IPv4/IPv6 gNMI NETCONF OpenConfig YANG DCBX LLDP Ansible Terraform-Provider
Wer baut diesen Stack

Drei Betreiberprofile. Eine Silicon-+-NOS-Kombination.

Derselbe TH5-Die, dasselbe OcNOS-DC-Image, drei verschiedene Rahmungen derselben architektonischen Frage: Wie skalieren Sie Lossless-East-West, ohne den gesamten Stack an einen einzigen Anbieter zu binden?

AI-Cluster-Operator

Training-Fabric bis zur 16k-GPU-Obergrenze auf Open Silicon.

"Wir brauchen 800G zum Leaf, verlustfreies RoCEv2 und eine Tail-Latency, die unter AllReduce nicht explodiert. Single-Vendor-Lock-in kommt nicht infrage."

TH5-64×800G-Spines, RoCEv2 mit xCCL-getuntem DCQCN, DLB-Rebinding im Submillisekundenbereich, PFC-Deadlock-Watchdog. Gleiche 64-Port-Radix wie TH4, aber jeder Spine-Port trägt 800G, was die Spine-Leaf-Verkabelung bei gleicher aggregierter Fabric-Bandbreite halbiert.

DC · AI-Fabric-SKU
NeoCloud · GPU-as-a-Service

Mandantenfähige Fabric, BoM unter Kontrolle.

"Unsere Kunden wählen die GPU. Wir können unsere Fabric-BoM nicht an deren NIC-Wahl koppeln. Wir brauchen einen Switch, den wir von mindestens zwei Herstellern beziehen können."

Three OcNOS-validated TH5 SKUs across two vendors (Edgecore, UfiSpace). VRF-Lite tenant isolation, gNMI per-tenant telemetry, EVPN-VXLAN segmentation. One NOS image, multi-vendor hardware.

DC · Multi-Tenant
Hyperscaler · Brownfield-Refresh

TH3/TH4-Fabric-Erneuerung ohne Forklift.

"Wir haben eine TH4-Fabric in Produktion. Der nächste Training-Cluster braucht 800G-NICs. Wir wollen nicht die gesamte NOS-Schicht neu entwerfen, um das Silicon aufzurüsten."

Dasselbe OcNOS-DC-Image läuft auf TH3-, TH4- und TH5-Plattformen. Ein Brownfield-Refresh hält Konfigurationen, Automatisierung und gNMI-Pipelines intakt. Das UEC-1.0-Fabric-Profil ist bereits auf die nächste NIC-Generation ausgerichtet.

DC · UEC-Ready
Häufig gestellt

Fragen, die Architekten stellen

Drei Open-Hardware-Plattformen von zwei ODMs: Edgecore AIS800-64D (DCS560-Chassis) sowie UfiSpace S9321-64E (QSFP-DD) und S9321-64EO (OSFP). Alle drei werden mit vorinstalliertem ONIE ausgeliefert und führen dasselbe OcNOS-DC-Image aus: gleiche Konfiguration, gleicher Funktionsumfang, gleiche Automatisierungs-Hooks. Zwei Anbieter bedeuten, dass eine Dual-Source-BoM für die Beschaffung im Hyperscale- und NeoCloud-Umfeld realistisch ist.
QSFP-DD (AIS800-64D und S9321-64E) ist das volumenstarke Optics-Ökosystem, der richtige Standard für Short-Reach-800G innerhalb des Rechenzentrums. OSFP (S9321-64EO) bietet leistungsstärkere Cages für Modulklassen, die QSFP-DD nicht aufnehmen kann: 800G ZR/ZR+ Coherent für DCI, Longer-Reach DR4/DR8 und steckbare Verstärker. Wählen Sie OSFP, wenn die Optik die Cage-Wahl bestimmt: andernfalls gewinnt QSFP-DD bei Kosten und Ökosystem-Breite.
TH4 bietet 25,6 Tbps · 64×400G · 7 nm · 50G PAM4. TH5 verdoppelt bei gleichem 64-Port-Radix die Geschwindigkeit pro Port und die gesamte Switching-Kapazität (51,2 Tbps · 64×800G · 5 nm · 100G PAM4). Entscheidungsregel: Wenn der Cluster nativ 800G-Ports benötigt oder jeder Spine-Port die doppelte Bandbreite tragen soll (was die Verkabelung bei gleichem aggregiertem Fabric-Durchsatz halbiert), wählen Sie TH5. Ist das Design um 400G-NICs und einen Single-Pod-Footprint herum aufgebaut, ist TH4 nach wie vor hervorragend und pro Port günstiger. OcNOS-DC unterstützt beide mit demselben Funktionsumfang: Ein Brownfield-Refresh bleibt sauber.
TH5 verfügt über die Hardware-Mechanismen, die UEC-1.0-Fabric-Profile benötigen: Per-Packet-ECMP, Packet-Spray-freundliches Forwarding, Shared-Buffer-Scheduling, das Out-of-Order-Delivery toleriert. UEC selbst lebt überwiegend in der NIC: TH5-Fabrics mit OcNOS-DC transportieren UEC-Traffic korrekt, sobald UEC-NICs in Volumen verfügbar sind. RoCEv2 und UEC koexistieren auf demselben Switch: Migrieren Sie Cluster NIC für NIC, ohne Fabric-Austausch.
Auf TH5 wird OcNOS-DC vorab abgestimmt für AI-Fabrics ausgeliefert: PFC über L3, ETS, Dynamic ECN, DLB Reactive-Path Rebalance, DLB Random-Flow, PFC Deadlock Detection & Recovery, xCCL-konforme Buffer-Profile, DCBX LLDP. Auf demselben Silicon läuft zudem ein vollständiger Carrier-Grade Layer-3-Stack (BGP, OSPF, IS-IS, SR-MPLS, EVPN-VXLAN), den reine AI-Stacks in der Regel nicht abdecken. 215 Features über 8 Kategorien validiert, jeder Eintrag in der öffentlichen OcNOS Feature Matrix überprüfbar.
SP-Edge, Cell-Site-Gateway, Sub-1-Tbps-Aggregation. Die 64×800G-Radix rechtfertigt in diesen Rollen ihren Rack-Platz nicht. Für SP-Routing validiert OcNOS Broadcom Qumran (Q2C, Q2C+) und Jericho (J2C+); für 100G/400G-DC-Leaf in Single-Pod-Footprints bietet Trident (TD3-X7, TD4) die bessere Wirtschaftlichkeit. Ehrliche Einordnung: TH5 setzt sich durch, wenn 800G-Radix und AI-Fabric-Primitives gleichermaßen relevant sind – nicht, wenn nur eines davon zählt.

Eine Tomahawk-5-Fabric entwerfen? Lassen Sie uns sie gemeinsam dimensionieren.

30-minute architecture session with an OcNOS network architect. Bring your GPU count, NIC speed, and tier preference, and leave with a sized BoM across all three TH5 SKUs.