BCM78900 · TSMC 5 nm · in spedizione da marzo 2023

Broadcom Tomahawk 5 Switch Tomahawk 5 Tre piattaforme aperte 800G, validate su OcNOS-DC.

Edgecore AIS800-64D, UfiSpace S9321-64E e S9321-64EO: stesso silicio, stessa immagine OcNOS-DC, tre percorsi di approvvigionamento. Specifiche, regole decisionali e la superficie di funzionalità OcNOS-DC per gli ingegneri che scelgono uno switch Tomahawk 5.

51.2Tbps
Capacità dello switch
64×800G
Native Port Radix
3SKUs
OcNOS-Validated
2ODMs
Edgecore · UfiSpace
5nm
Processo TSMC N5
01
Gli switch
Hardware aperto con Tomahawk 5

Tre piattaforme 800G. Due ODM. Un'unica immagine OcNOS-DC.

Two hardware designs, three SKUs. All three ship ONIE pre-loaded and run the same OcNOS-DC image. The differences are form factor (QSFP-DD vs OSFP), branding (AI-fabric SKU vs general-DC SKU), and which optics ecosystem the deployment is built around. Each card links to the full vendor datasheet (PDF, hosted locally).

Edgecore· Famiglia di piattaforme DCS560
Spine per fabric AI

AIS800-64D

Validato su OcNOS-DC · ONIE precaricato
Ports
64 × QSFP-DD800Breakout: 2×400 / 4×200 / 8×100 (320 porte logiche)
Form
2RU
Power
2× 3000 W AC/DC ridondanti30 W per cage QSFP-DD
CPU
Intel Xeon D1713NTE
▌ Scegli questo quando

AI fabric per cluster GPU. Chassis Edgecore DCS560 con il framing dello SKU AI-fabric.

UfiSpace· Famiglia di piattaforme S9321
Spine per fabric AI

S9321-64E

Validato su OcNOS-DC · ONIE precaricato
Ports
64 × QSFP-DD (200/400/800G)Breakout: 2×400 / 4×200 / 8×100
Form
2RU · 23.72 kg
Power
913 W tipici (senza transceiver)30 W per cage QSFP-DD
CPU
Intel Icelake-D 4-core · 32 GB DDR4
▌ Scegli questo quando

Flussi AI di grandi dimensioni e a bassa entropia. UfiSpace posiziona il 64E per il traffico dominato da AllReduce, in cui il routing adattivo del TH5 costituisce il fulcro del design.

UfiSpace· Famiglia di piattaforme S9321
800G DCI · ottica coerente

S9321-64EO

Validato su OcNOS-DC · ONIE precaricato
Ports
64 × OSFP (200/400/800G)Breakout: 2×400 / 4×200 / 8×100
Form
2RU · 23.74 kg
Power
925 W typical · 200-240 V ACGabbie OSFP per ottiche a maggiore potenza
CPU
Intel Icelake-D · 32 GB DDR4
▌ Scegli questo quando

Moduli coerenti 800G ZR/ZR+ o altre classi di moduli a potenza più elevata. Form factor OSFP del 64E: da scegliere quando sono le ottiche a determinare la scelta del cage.

· How to choose between the three

AIS800 vs S9321-64ELo stesso silicio TH5, due ODM. Edgecore DCS560 (AIS800-64D) vs UfiSpace S9321: BoM dual-source per l'approvvigionamento hyperscale e NeoCloud.
QSFP-DD vs OSFPQSFP-DD (S9321-64E and AIS800-64D) for the high-volume optics ecosystem. OSFP (S9321-64EO) for higher-power module classes including 800G ZR/ZR+ coherent.
Edgecore vs UfiSpaceEntrambi sono ODM open-hardware con una solida co-progettazione IP Infusion. Scelga in base alla sua relazione con l'ODM, alla logistica RMA o all'economia della BoM.
Rischio di un singolo vendorDue vendor con piattaforme TH5 significano che una BoM dual-source è realistica, importante per il procurement hyperscale e NeoCloud.
02
All'interno del silicio
Cosa offrono 51,2 Tbps in un unico die

Tomahawk 5: l'ASIC switch merchant di punta di Broadcom.

The BCM78900 è un singolo die monolitico a 5 nm che eroga 51,2 Tbps di capacità di switching, alimentando 64 porte da 800GbE, 128 da 400G o 256 da 200G nativamente. È stato il primo IC switch merchant a 5 nm di Broadcom e il primo prodotto in assoluto a supportare 800GbE alla gabbia. 512 corsie SerDes a 100G PAM4: lo stesso numero di lane del Tomahawk 4, il doppio della velocità per lane.

Oltre alla capacità grezza, tre scelte architetturali hanno reso TH5 il silicio alla base della maggior parte delle AI fabric di produzione: a architettura shared-buffer che assorbe in hardware i micro-burst collettivi xCCL (NCCL / RCCL / oneCCL) Cognitive Routing (DLB) che effettua il rebinding degli elephant flow nell'ASIC, e un headroom termico a 5 nm che consente di far funzionare cage QSFP-DD800 da 30 W senza raffreddamento attivo per porta.

Specifiche verificabili rispetto alla documentazione pubblica di Broadcom Pagina prodotto BCM78900.

ProcessoTSMC N5 SeriesStrataXGS BufferCondiviso, ottimizzato per RDMA RoutingCognitivo · DLB ShippingDa mar 2023
Port radix del Broadcom Tomahawk 5 (BCM78900) mostrato come una griglia di 64 porte, ciascuna 800G QSFP-DD, per un totale di 51,2 Tbps di switching su un singolo die
Come si presentano 64 x 800G: 512 lane da 100G PAM4 per un totale di 51,2 Tbps sul die BCM78900.
Quattro scelte progettuali che contano

Perché il TH5 è finito in quasi ogni AI fabric open costruito dal 2024.

Il numero di punta conquista la stampa. Sono queste quattro scelte ingegneristiche ciò che agli architetti di fabric AI interessa davvero.

PRINCIPLE 01

Stesso numero di corsie, velocità doppia.

TH5 dispone delle stesse 512 lane SerDes di TH4, facendole girare a 100G PAM4 anziché a 50G. Il raddoppio del throughput è arrivato accelerando l'infrastruttura esistente, non aggiungendone di nuova.

100G PAM4 · 106 Gbps
PRINCIPLE 02

Buffer condiviso, non partizionato.

Pool di memoria pacchetti condivisi su tutte le 64 porte, non suddivisi per singola porta. I micro-burst xCCL AllReduce su una porta vengono assorbiti nel pool fabric-wide invece di innescare tail-drop. Il motivo in una riga per cui TH5 vince su RoCEv2.

Shared-buffer · RDMA-tuned
PRINCIPLE 03

Routing adattivo via hardware.

Il Cognitive Routing di Broadcom rileva i percorsi congestionati e ridistribuisce gli elephant flow nell'ASIC: nessun round-trip verso il controller, nessun rehashing ECMP. OcNOS-DC lo attiva come DLB Reactive-Path Rebalance.

DLB · flowlet da 64 µs
PRINCIPLE 04

Margine termico a 5 nm.

Il primo IC switch merchant a 5 nm. È stato il process shrink a rendere fattibili 30 W per cage QSFP-DD800 senza raffreddamento attivo per porta, comprese le ottiche 800G ad alta potenza e i breakout 8×100G.

TSMC N5 · 30 W/port
03
Salto generazionale
Tomahawk 4 → Tomahawk 5

Velocità per porta raddoppiata. Capacità raddoppiata. Stesso radix a 64 porte.

Inquadramento onesto: TH4 (25,6 Tbps · 64×400G · 7 nm) resta eccellente per cluster costruiti attorno a NIC 400G. TH5 si guadagna il proprio spazio nel rack quando contano sia 800G per porta sia le primitive di AI fabric.

Capacità di switching
25.6 Tbps 51,2 Tbps

Raddoppiato nello stesso ingombro rack. Stesso 2RU, stessa classe di consumo energetico.

Velocità per porta
64 × 400G 64 × 800G

Lo stesso radix a 64 porte sulle effettive piattaforme IPI (AS9736-64D → AIS800-64D / S9321). La banda per porta raddoppia, quindi ogni livello Clos trasporta il doppio del traffico.

Nodo di processo
7 nm 5 nm

Primo IC switch merchant a 5 nm. Margine termico per 30 W/porta senza raffreddamento attivo.

SerDes per lane
50G PAM4 100G PAM4

Stesse 512 lane, velocità doppia. Il raddoppio del throughput è arrivato dall'infrastruttura esistente.

Il refresh brownfield resta pulito. La stessa immagine OcNOS-DC gira sulle piattaforme TH3, TH4 e TH5: configurazioni, automazione e pipeline gNMI vengono riportate senza modifiche. Scelga TH5 per il prossimo cluster e mantenga TH4 dove già funziona.
04
Cosa include OcNOS-DC
OcNOS-DC su questo silicio

NOS carrier-grade. Impostazioni predefinite ottimizzate per l'AI.

Tomahawk 5 dispone dell'hardware. Il compito del NOS è esporlo, agli operatori, alle pipeline di telemetria, allo scheduler del cluster, senza costringerli a contorsioni di CLI per gestirlo. OcNOS-DC offre queste primitive come oggetti configurabili di prima classe con stato modellato in YANG.

RoCEv2 lossless

Architettura a shared-buffer, east-west zero-drop.

OcNOS-DC fornisce PFC + ETS + Dynamic ECN pre-tarati sui pattern collettivi xCCL. La latenza di coda rimane contenuta anche sotto i micro-burst AllReduce che mettono fuori uso i fabric NOS community. Il pool di buffer condiviso del TH5 assorbe il traffico sincronizzato many-to-one che provocherebbe tail-drop su chip con buffer partizionati.

Adaptive Routing

Il DLB riassocia i flowlet in 64 µs.

La collisione di hash ECMP sotto elephant flow è il vero killer dell'AI fabric. OcNOS-DC attiva il flowlet rebinding del Cognitive Routing di TH5, così il traffico AllReduce si distribuisce automaticamente su ogni percorso spine.

Watchdog deadlock PFC

Per-port, per-priority. Auto-drain.

Rileva i cicli di coda in pause prima che blocchino i job di training. Recupero automatico senza intervento dell'operatore.

Telemetria in streaming

gNMI on-change, OpenConfig YANG.

Profondità del buffer, marcature ECN, conteggi delle pause PFC: ogni soglia è una manopola, ogni contatore un sensor path. Si integra con Prometheus, Grafana, OTel.

Rete reale

BGP · OSPF · IS-IS · EVPN-VXLAN.

Lo spine TH5 è anche un vero router. Stack Layer 3 carrier-grade completo sullo stesso silicio: gestisci il fabric AI come il resto della tua rete, non come una scatola nera.

Superficie di funzionalità validata

215 funzionalità in 8 categorie, estratte dalla Feature Matrix OcNOS aggiornata.

Layer 3 routing · L1/L2 · AI fabric primitives · Multicast · QoS · Security · Hardware · Management. Every entry verifiable per-platform on the public matrix.

RoCEv2 / PFC DCQCN DLB EVPN-VXLAN SR-MPLS BGP / OSPF / IS-IS gNMI / NETCONF ZTP Pronto per UEC 1.0
Day-0 to Day-2

ZTP. gNMI on-change. NETCONF + YANG. DCBX.

Attivi una spine TH5 nel rack con zero-touch provisioning. Esegua lo streaming di ogni counter verso il Suo stack di observability. Regoli ogni soglia tramite config modellata in YANG. Nessuno script di collante.

ZTP IPv4/IPv6 gNMI NETCONF OpenConfig YANG DCBX LLDP Ansible Provider Terraform
Chi costruisce questo stack

Tre profili operatore. Una sola combinazione silicio + NOS.

Stesso die TH5, stessa immagine OcNOS-DC, tre diverse formulazioni della stessa domanda architetturale: come scalare l'east-west lossless senza vincolare l'intero stack a un unico vendor?

AI Cluster Operator

Fabric di training fino al tetto dei 16k GPU su silicio aperto.

"Ci servono 800G verso il leaf, RoCEv2 lossless e una tail latency che non esploda sotto AllReduce. Il lock-in su un singolo vendor non è un'opzione."

Spine TH5 64×800G, RoCEv2 con DCQCN ottimizzato per xCCL, rebinding DLB sub-millisecondo, PFC deadlock watchdog. Stessa radix a 64 porte del TH4, ma ogni porta dello spine trasporta 800G, dimezzando il cablaggio spine-leaf a parità di banda aggregata della fabric.

SKU DC · AI Fabric
NeoCloud · GPU-as-a-Service

Fabric multi-tenant, BoM sotto controllo.

"I nostri clienti scelgono la GPU. Non possiamo legare la BoM del nostro fabric alla loro scelta della NIC. Ci serve uno switch che possiamo acquistare da almeno due fornitori."

Three OcNOS-validated TH5 SKUs across two vendors (Edgecore, UfiSpace). VRF-Lite tenant isolation, gNMI per-tenant telemetry, EVPN-VXLAN segmentation. One NOS image, multi-vendor hardware.

DC · Multi-Tenant
Hyperscaler · Refresh brownfield

Refresh della fabric TH3/TH4 senza forklift.

"Abbiamo un fabric TH4 in produzione. Il prossimo training cluster richiede NIC 800G. Non vogliamo riprogettare l'intero layer NOS per aggiornare il silicio."

La stessa immagine OcNOS-DC gira sulle piattaforme TH3, TH4 e TH5. Il refresh brownfield mantiene intatte configurazioni, automazione e pipeline gNMI. Il profilo fabric UEC 1.0 è già allineato per la prossima generazione di NIC.

DC · UEC-Ready
Domande frequenti

Domande che pongono gli architetti

Tre piattaforme open-hardware su due ODM: Edgecore AIS800-64D (chassis DCS560), UfiSpace S9321-64E (QSFP-DD) e S9321-64EO (OSFP). Tutte e tre vengono fornite con ONIE precaricato ed eseguono la stessa immagine OcNOS-DC: stessa configurazione, stessa superficie funzionale, stessi hook di automazione. Due vendor significano che una BoM dual-source è realistica per gli approvvigionamenti hyperscale e NeoCloud.
QSFP-DD (AIS800-64D e S9321-64E) è l'ecosistema ottico ad alto volume, l'impostazione predefinita giusta per gli 800G short-reach all'interno del data center. OSFP (S9321-64EO) fornisce cage a maggiore potenza per classi di moduli che QSFP-DD non può ospitare: ottiche coherent 800G ZR/ZR+ per il DCI, DR4/DR8 a portata più lunga e amplificatori pluggable. Scegliete OSFP quando sono le ottiche a determinare la scelta della cage; altrimenti QSFP-DD vince su costo e ampiezza dell'ecosistema.
TH4 è 25,6 Tbps · 64×400G · 7 nm · 50G PAM4. TH5 raddoppia la velocità per porta e la capacità di switching totale a parità di radix di 64 porte (51,2 Tbps · 64×800G · 5 nm · 100G PAM4). Regola decisionale: se il cluster richiede porte 800G in modo nativo, o se ogni porta spine deve trasportare il doppio della banda (dimezzando il cable plant a parità di throughput aggregato della fabric), scelga TH5. Se il design è costruito attorno a NIC 400G e a un footprint single-pod, TH4 resta eccellente e più economico per porta. OcNOS-DC supporta entrambi con lo stesso set di funzionalità: il refresh in brownfield resta pulito.
TH5 dispone dei meccanismi hardware di cui hanno bisogno i fabric profile UEC 1.0: ECMP per-pacchetto, forwarding compatibile con il packet-spray, scheduling shared-buffer che tollera la consegna out-of-order. UEC stesso risiede principalmente nella NIC; i fabric TH5 che eseguono OcNOS-DC trasporteranno correttamente il traffico UEC quando le NIC UEC saranno disponibili in volume. RoCEv2 e UEC coesistono sullo stesso switch: migrate i cluster NIC per NIC, senza sostituzione del fabric.
Su TH5, OcNOS-DC viene fornito pre-ottimizzato per i fabric AI: PFC over L3, ETS, Dynamic ECN, DLB Reactive-Path Rebalance, DLB Random-Flow, PFC Deadlock Detection & Recovery, profili di buffer allineati a xCCL, DCBX LLDP. Sullo stesso silicio esegue inoltre uno stack Layer 3 carrier-grade completo (BGP, OSPF, IS-IS, SR-MPLS, EVPN-VXLAN) che gli stack solo-AI in genere non coprono. 215 funzionalità validate in 8 categorie, ogni voce verificabile sulla Feature Matrix pubblica di OcNOS.
Edge SP, gateway cell-site, aggregazione sub-1 Tbps. Il radix 64×800G non giustifica il proprio spazio in rack in questi ruoli. Per il routing SP, OcNOS valida Broadcom Qumran (Q2C, Q2C+) e Jericho (J2C+); per leaf DC 100G/400G in deployment single-pod, Trident (TD3-X7, TD4) offre un'economia migliore. Inquadramento onesto: TH5 vince quando contano sia il radix 800G sia le primitive AI fabric, non quando ne conta una sola.

Sta progettando un fabric Tomahawk 5? Dimensioniamolo insieme.

30-minute architecture session with an OcNOS network architect. Bring your GPU count, NIC speed, and tier preference, and leave with a sized BoM across all three TH5 SKUs.