BCM56990 · TSMC 7 nm · 25.6 Tbps · 64×400G

Broadcom Tomahawk 4 Switch Tomahawk 4 25.6 Tbps · 64 × 400G · la generazione 400G a costi contenuti.

Una piattaforma aperta validata su OcNOS-DC: Edgecore AS9736-64D. Tomahawk 4 è il livello 400G a costi contenuti: 25.6 Tbps di 64×400G su 7nm, con la stessa architettura shared-buffer a bassa latenza e lo stesso set di funzionalità OcNOS-DC dello spine TH5 800G, con l'economia dei 400G.

25.6Tbps
Capacità dello switch
64×400G
Native Port Radix
~114MB
Shared Buffer
7nm
Processo TSMC N7
50GPAM4
SerDes per lane
01
Lo switch
Hardware aperto con Tomahawk 4

Una piattaforma. Uno scopo: 400G a costi contenuti.

Edgecore AS9736-64D: uno switch 2RU 64×400G QSFP-DD sul BCM56990 Tomahawk 4. ONIE precaricato, esegue la stessa immagine OcNOS-DC degli spine TH5 e delle leaf TD4. Una piattaforma validata: il livello 64×400G del portfolio OcNOS-DC, al di sotto dello spine TH5 800G.

Edgecore· Famiglia di piattaforme DCS520
AI fabric 400G · DCI

AS9736-64D

Validato su OcNOS-DC · ONIE precaricato
Porte
64 × QSFP-DD (400G)Breakout: 2×200 / 4×100 / 2×50 (up to 256 logical ports)
Form
2RU · 21.5 kg
Power
~2100 W tipici · alimentazione AC ridondante hot-swap~33 W per cage QSFP-DD
CPU
Intel Xeon classe D · 32 GB RAM
▌ Scegli questo quando

AI fabric 400G per cluster GPU single-pod su NIC 400G, e ruoli di aggregazione 400G / DCI, dove 25.6T di 64×400G al costo del merchant-silicon svolge il compito senza pagare per porte 800G.

Lei è qui · 25.6 Tbps

Tomahawk 4: 64 × 400G

Scegli quando le NIC 400G ancorano il cluster e il costo per porta conta: 25.6 Tbps di 64×400G con il set completo di funzionalità OcNOS-DC, al di sotto del prezzo del silicio 800G.

Sali di livello · 51,2 Tbps

Tomahawk 5: 64 × 800G

Scegliere quando il cluster necessita di porte 800G in modo nativo, oppure quando 800G per porta con lo stesso radix a 64 porte vale il sovrapprezzo per porta. Pagina Tomahawk 5 →

Box più compatto · 12,8 Tbps

Trident 4: DC leaf

Da scegliere quando il ruolo è leaf DC a 100G/400G con un envelope di capacità inferiore. Famiglia di chip diversa, stessa immagine OcNOS-DC, molto più economico per porta. (Pagina Trident 4 in arrivo.)

02
All'interno del silicio
Cosa offre Tomahawk 4 a una fabric 400G

Tomahawk 4: lo switch chip 25.6T a costi contenuti.

Tomahawk 4 (BCM56990) è uno switch da 25.6 Tbps su TSMC 7nm con radix nativo 64×400G. Come TH3 e TH5, utilizza un on-die shared-buffer architettura nella classe delle basse centinaia di megabyte, ottimizzata per RoCEv2 lossless. È uno switch chip a bassa latenza, non un router chip deep-buffer: per il buffering su scala GB si ricorre a un componente Jericho o Qumran StrataDNX, ma per una fabric AI o DC 400G lo shared buffer più il DLB sono esattamente lo strumento giusto.

Perché è importante: RoCEv2 lossless si basa su PFC + ECN + DCQCN per mantenere le code poco profonde, e sul DLB per distribuire gli elephant flow in modo che nessuna singola coda si accumuli. TH4 esegue tutto questo nell'ASIC a 400G, lo stesso set di strumenti per il controllo della congestione che OcNOS-DC offre sullo spine TH5 800G. Una fabric TH4 e una fabric TH5 si comportano allo stesso modo; la differenza è la velocità di porta e il costo, non la parte lossless.

Specifiche verificate rispetto a quelle di Broadcom Pagina prodotto BCM56990 Tomahawk 4 e la feature matrix OcNOS in tempo reale.

ProcessoTSMC N7 SeriesStrataXGS BufferOn-die shared RoutingCognitivo · DLB ShippingDal 2020
Radix di porta Broadcom Tomahawk 4 (BCM56990) mostrato come una griglia di 64 porte, ciascuna 400G, per un totale di 25.6 Tbps
Come si presenta 64 x 400G: 512 lane di 50G PAM4 per un totale di 25.6 Tbps sul die BCM56990.
Quattro scelte progettuali che contano

Perché il TH4 resta nella conversazione sull'AI fabric anche dopo il rilascio del TH5.

400G con l'economia del merchant-silicon, con la stessa superficie di funzionalità e la stessa architettura shared-buffer a bassa latenza del TH5 800G.

PRINCIPIO 02

SerDes 50G PAM4: 512 lane.

TH3 ha raggiunto 12.8T con 256 lane di 50G PAM4; TH4 raddoppia a 512 lane con lo stesso 50G PAM4 per 25.6T; TH5 mantiene 512 lane e passa a 100G PAM4. Otto lane per gabbia QSFP-DD danno 400G nativo; il breakout si estende a 200G/100G/50G per deployment a velocità miste.

512 lane · 50G PAM4
PRINCIPIO 03

Routing adattivo via hardware.

Broadcom Cognitive Routing: bilanciamento del carico flowlet-aware nell'ASIC, senza round-trip verso il controller. OcNOS-DC lo attiva come DLB Reactive-Path Rebalance, distribuendo gli elephant flow attraverso la fabric in modo che nessuna singola coda si accumuli sotto il traffico collettivo RoCEv2.

DLB · rebinding dei flowlet
PRINCIPIO 04

Silicio maturo a 7 nm.

In spedizione in volume dal 2020: oltre quattro anni di bug fix, comportamento prevedibile e un envelope termico noto. Per il refresh brownfield di una fabric TH3, è la scelta noiosa e prevedibile.

TSMC N7 · oltre 4 anni di shipping
03
Salto generazionale
Tomahawk 3 → Tomahawk 4

Capacità raddoppiata. Radix raddoppiato. Processo ridotto.

TH3 (12.8 Tbps · 32×400G · 16 nm · 50G PAM4) è stato il cavallo di battaglia dell'era pre-AI-fabric. TH4 ha raddoppiato la capacità e il radix di porta con una riduzione di processo di due nodi, con l'economia dei 400G.

Capacità di switching
12.8 Tbps 25.6 Tbps

Raddoppiato nello stesso ingombro rack. 2RU sono rimaste 2RU.

Radix di porta nativo
32 × 400G 64 × 400G

Il doppio delle porte alla stessa velocità: si adatta ai design Clos senza un livello aggiuntivo.

Nodo di processo
16 nm 7 nm

Riduzione in due fasi. Margine di potenza per porta per ottiche 400G senza raffreddamento attivo per porta.

SerDes lanes
256 lanes 512 lanes

Stesso 50G PAM4 per lane, il doppio delle lane (256 → 512). È da qui che deriva il raddoppio della capacità.

Il prossimo salto: TH5 raddoppia di nuovo a 51.2 Tbps e 64 × 800G con SerDes 100G PAM4. TH4 rimane il livello 400G a costi contenuti per i cluster che non hanno ancora bisogno di porte 800G. Pagina Tomahawk 5 →
04
Cosa include OcNOS-DC
OcNOS-DC su questo silicio

Stessa immagine dello spine TH5. Stesso set di strumenti lossless-fabric.

OcNOS-DC funziona in modo identico sulle piattaforme TH3, TH4 e TH5: la stessa fabric RoCEv2 lossless (PFC + ECN + DCQCN), il routing adattivo DLB e la telemetria in streaming. Una fabric TH4 400G e una fabric TH5 800G si configurano e si gestiscono allo stesso modo; cambia solo la velocità di porta.

RoCEv2 lossless · shared-buffer

PFC + ECN pre-tuned to xCCL, and the shared buffer absorbs the rest.

PFC + ETS + Dynamic ECN standard con profili di buffer DCQCN ottimizzati per i collettivi RDMA. Il DLB mantiene distribuiti gli elephant flow in modo che le code restino poco profonde, e il watchdog anti-deadlock PFC protegge dalle pause storm. Il set completo di strumenti lossless che OcNOS-DC offre su TH5, a 400G.

Adaptive Routing

DLB riassegna i flowlet nell'ASIC.

Cognitive Routing su TH4 esegue lo stesso DLB Reactive-Path Rebalance che OcNOS-DC offre su TH5: il rebinding dei flowlet risolve le collisioni di hash ECMP nell'ASIC, senza round-trip verso il controller.

Watchdog deadlock PFC

Per porta, per priorità. Svuotamento automatico.

Rileva i cicli di code in pausa prima che blocchino i job di training, e le svuota automaticamente in modo che una pause storm PFC non possa bloccare un collettivo.

Telemetria in streaming

Buffer e congestione sul filo.

gNMI on-change per la profondità del buffer, i mark ECN e i conteggi delle pause PFC. Visibilità completa della congestione, non una scatola nera.

Rete reale

BGP · OSPF · IS-IS · EVPN-VXLAN.

Stack Layer 3 completo carrier-grade sullo stesso silicio. Lo spine TH4 è anche un vero router: lo operi come il resto della Sua rete, non come una black box.

Superficie di funzionalità validata

Stessa immagine OcNOS-DC di TH5: ogni funzionalità si attiva dove il silicio la supporta.

Routing Layer 3 · L1/L2 · primitive AI fabric · Multicast · QoS · Sicurezza · Hardware · Gestione. Validazione per piattaforma visibile sulla matrice pubblica.

RoCEv2 / PFC DCQCN DLB EVPN-VXLAN BGP / OSPF / IS-IS gNMI / NETCONF ZTP buffer telemetry
Day-0 to Day-2

ZTP. gNMI on-change. NETCONF + YANG. DCBX.

Attiva l'AS9736-64D nel rack con lo zero-touch provisioning. Trasmetti in streaming ogni contatore, incluso lo stato del buffer e di PFC/ECN, al tuo stack di observability. Regola ogni soglia tramite configurazione modellata in YANG. Nessuno script di collegamento.

ZTP IPv4/IPv6 gNMI NETCONF OpenConfig YANG DCBX LLDP Ansible Provider Terraform
Chi costruisce questo stack

Tre profili operatore. Un solo silicio per tutti e tre.

Il radix 64×400G con l'economia dei 400G colloca l'AS9736-64D in tre diverse conversazioni: AI fabric, DCI e refresh brownfield. Stesso switch, diversa formulazione della stessa domanda architetturale.

AI Cluster Operator · pod NIC 400G

Fabric NIC 400G senza pagare per il silicio 800G.

"Il nostro cluster è su NIC 400G. Non abbiamo ancora bisogno di porte 800G e non paghiamo il sovrapprezzo degli 800G per porte che non possiamo usare."

Spine TH4 su AS9736-64D, RoCEv2 lossless con DCQCN ottimizzato per i collettivi RDMA, rebinding DLB sub-millisecondo. Clos a tre livelli per lo scale-out multi-pod, stessa immagine OcNOS-DC del deployment TH5 adiacente.

DC · 400G Spine
DCI · Aggregation Architect

400G DCI transport without a chassis-router bill.

"Our cross-DC links need 400G aggregation and EVPN transport at a sane price. Chassis routers cost ten times what this should."

64×400G at merchant-silicon cost, EVPN-VXLAN inter-DC, full L3 stack, per-tenant gNMI telemetry. Open hardware for 400G DCI transport without the 800G price. Where the design must absorb sustained deep-buffer congestion, that is a StrataDNX Jericho job, not TH4.

DC · DCI · Aggregazione
Brownfield · Refresh TH3

Capacità raddoppiata, stesso modello operativo.

"Abbiamo un fabric TH3 in produzione. Ci serve più capacità, ma non vogliamo riprogettare il livello NOS né riqualificare il team di rete."

La stessa immagine OcNOS-DC gira su TH3 e TH4. Il refresh brownfield mantiene intatti config, automazione e pipeline gNMI. La capacità raddoppia. Il modello operativo resta invariato.

DC · Aggiornamento
Domande frequenti

Domande che pongono gli architetti

Una piattaforma: la Edgecore AS9736-64D, uno switch 2RU 64×400G QSFP-DD costruito sul Broadcom BCM56990 (Tomahawk 4, 25.6 Tbps). Viene fornito con ONIE precaricato, esegue la stessa immagine OcNOS-DC degli spine TH5 e delle leaf TD4. È il cavallo di battaglia 64×400G del portfolio OcNOS-DC.
Costo. Su scala single-pod con NIC GPU 400G, una fabric TH4 costa meno per porta di TH5 senza compromessi architetturali: 25.6 Tbps di 64×400G, la superficie completa di funzionalità OcNOS-DC e la stessa architettura shared-buffer a bassa latenza di TH5. Il Clos a tre livelli è ancora adatto. Si passa a TH5 (800G) solo quando le porte 800G sono nella BoM, o si vuole dimezzare il cablaggio spine-leaf a parità di banda aggregata.
Tomahawk 4 is a shared-buffer, bassa latenza switch chip, non un router chip deep-buffer. Il suo buffer di pacchetti on-die è nella classe delle basse centinaia di megabyte, la stessa architettura di TH3 e TH5, dimensionato per RoCEv2 lossless con PFC + ECN + DCQCN. Per il deep buffering su scala GB (hold DCI long-haul, pesante fan-in N:1) serve un router chip Jericho o Qumran StrataDNX. Per una fabric AI o DC 400G a bassa latenza, lo shared buffer di TH4 più il routing adattivo DLB sono lo strumento giusto.
Scegli TH5 (AIS800-64D) quando le porte 800G sono nella BoM, o vuoi 800G per porta con lo stesso radix a 64 porte (dimezza il cablaggio spine-leaf a parità di banda aggregata). Scegli TH4 (AS9736-64D) quando le NIC 400G sono l'ancora del cluster e il budget per porta esclude il silicio 800G. Entrambi eseguono la stessa immagine OcNOS-DC. Combinarli in una fabric multi-tier è un deployment supportato.
Yes. TH4 has the same Cognitive Routing primitives as TH5: flowlet-aware load-balancing in the ASIC, no controller round-trip. OcNOS-DC turns this on as DLB Reactive-Path Rebalance, so a TH4 fabric resolves elephant-flow hash collisions in hardware. PFC deadlock detection & recovery, DCQCN, and ETS are all available.
Capacità raddoppiata due volte (12.8 → 25.6 → 51.2 Tbps). Processo ridotto due volte (16 → 7 → 5 nm). Il numero di lane è raddoppiato da TH3 a TH4 (256 → 512 lane) a 50G PAM4, poi TH5 ha mantenuto 512 lane e raddoppiato per lane a 100G PAM4. Tutti e tre usano un'architettura shared-buffer. OcNOS-DC supporta tutti e tre con la stessa immagine: il refresh brownfield mantiene intatte le configurazioni e le pipeline gNMI.
Il radix 64×400G è sovradimensionato per SP edge sub-1 Tbps o gateway cell-site: per questi scegli Qumran (Q2A/Q2U/Q2C). Anche per una leaf DC pura a 100G/25G è la forma sbagliata: scegli Trident 4 (TD4) a 12.8 Tbps. E se il cluster ha davvero bisogno di porte 800G oggi, TH4 impone un livello Clos aggiuntivo, quindi scegli TH5. Il punto di forza di TH4 è "400G è sufficiente, e il costo per porta conta."

Stai progettando una fabric 400G? Dimensioniamola insieme.

Sessione di architettura di 30 minuti con un network architect OcNOS. Portate il numero di GPU, la velocità delle NIC e le aspettative sui pattern di burst e uscite con una BoM dimensionata attorno all'AS9736-64D e un piano di posizionamento rispetto alle alternative TH5 / TD4.