InfiniBand vs Ethernet per AI Fabric
Per la maggior parte dei fabric AI, Ethernet. Per l'HPC critico per la latenza, InfiniBand. L'Ethernet moderno con RoCEv2 gestisce oggi fabric di produzione a 400G e 800G su hardware aperto e multi-vendor, e OcNOS-DC lo rende disponibile già ora. Questa guida illustra dove ciascuno trova ancora spazio.
Le stesse GPU, due reti molto diverse
A sinistra, un fabric InfiniBand single-vendor: un solo fornitore di silicio, una sola linea di switch, un solo ecosistema di NIC e un subnet manager separato dal resto del data center. A destra, un fabric Ethernet aperto e multi-vendor: NIC RoCEv2 o UEC di qualsiasi fornitore, silicio di switch Broadcom, OcNOS-DC come NOS e gli stessi protocolli che già utilizzate.
InfiniBand ed Ethernet, asse per asse
InfiniBand è stato progettato appositamente per RDMA lossless a bassa latenza e per due decenni questo gli ha dato un vantaggio concreto per l'HPC strettamente accoppiato. L'Ethernet moderno, costruito sullo stack DCB, RoCEv2 e sempre più DLB e UEC, ha passato gli ultimi anni a colmare quel divario. Quali lacune contino ancora dipende dal carico di lavoro.
| Axis | InfiniBandsingle-vendor | EthernetRoCEv2 / UEC, aperto |
|---|---|---|
| Soglia minima di latenza | Latenza NIC-to-NIC end-to-end molto bassa; hop dello switch tipicamente di centinaia di nanosecondi. | Floor più alto di IB di alcune centinaia di nanosecondi, ma ben al di sotto della soglia che incide sulla maggior parte dei collective di distributed-training su larga scala. |
| Tolleranza alla perdita | Lossless per architettura (flow control basato su credito). | Lossless tramite PFC + ECN + DCQCN. Di livello produzione già oggi; UEC riduce ulteriormente la dipendenza dal pause PFC. |
| Multipath / bilanciamento del carico | Routing adattivo integrato nella specifica. | ECMP statico, più DLB per il single-hop adattivo, GLB (OcNOS 7.1) per l'end-to-end, packet-spray UEC per la prossima generazione. |
| Ecosistema di vendor | Di fatto single-vendor sia per il silicio NIC sia per quello degli switch. | Multi-vendor a ogni livello: ASIC, switch, NIC, NOS, ottica. UEC è progettato esplicitamente per l'interoperabilità vendor-neutral. |
| Modello operativo | Subnet manager (classe UFM). Diverso dal resto del DC. Competenze separate, tooling separato. | Gli stessi BGP, EVPN, gNMI che già utilizza. Gli stessi strumenti di automazione (Ansible, NETCONF, OpenConfig) del resto del DC. |
| Multi-tenancy | Limitato; il partizionamento esiste ma non è un concetto di prima classe. | Di prima classe tramite EVPN-VXLAN. GPU-as-a-Service, cluster multi-team, infrastruttura condivisa: tutto naturale. |
| DCI a lunga distanza | Non progettato a tale scopo; richiede gateway IB-over-WAN. | Nativo tramite pluggable coerenti 400G ZR/ZR+ ed EVPN inter-DC. |
| Convergenza dello storage | Lo storage gira accanto al compute; richiede storage IB-attached. | NVMe-oF, NFS, S3 tutti sullo stesso fabric Ethernet. |
| Costo / porta (tipico 400G+) | Premium; prezzi single-vendor. | Uno spine su hardware aperto + NOS OcNOS-DC batte in modo sostanziale le alternative vendor-locked. |
| Velocità della roadmap | Guidato dalla cadenza di rilascio di un unico vendor. | Il consorzio UEC (AMD, Arista, Broadcom, Cisco, HPE, Intel, Meta, Microsoft, Oracle) guida l'evoluzione di specifiche pubblicate apertamente. |
Dove ciascuno eccelle
La risposta giusta dipende dal carico di lavoro. Scegliete InfiniBand dove il requisito è un limite di latenza assoluto; scegliete Ethernet dove il modello operativo, il costo o la copertura tra più sedi guidano la decisione.
Il limite di latenza è contrattuale
Simulazioni HPC in cui il limite di latenza assoluto conta più del costo totale di proprietà, e cluster single-tenant compatti e dedicati in cui il lock-in è accettabile.
Il modello operativo conta
GPU-as-a-Service multi-tenant e cluster che condividono l'infrastruttura con il resto del data center, dove vincono un unico modello operativo, un unico stack di strumenti e una catena di fornitura multi-vendor.
Il costo per GPU-flop è il fattore decisivo
Le spine su hardware aperto con OcNOS-DC eliminano il sovrapprezzo della rete single-vendor. Su un cluster di diverse migliaia di GPU, si tratta di una quota rilevante del budget hardware.
Il fabric si estende tra data center
Se una sessione di training dovrà mai attraversare due sale o due regioni, DCI coerente, EVPN inter-DC e ottiche standard multi-vendor lo trasformano in un problema di un giorno anziché in un progetto di line-system lungo un trimestre.
Cosa ha aggiunto l'Ethernet moderno
Tre sviluppi hanno portato i fabric AI di produzione su Ethernet: un comportamento realmente lossless, il routing adattivo che tiene i flussi lontani dagli uplink congestionati e un trasporto di nuova generazione adatto al packet spray.
Comportamento lossless
RoCEv2 with PFC, DCQCN e il watchdog anti-deadlock PFC fornisce il trasporto RDMA lossless di cui hanno bisogno le collettive AI, di livello produttivo già oggi su Ethernet standard.
Routing adattivo
Le collisioni ECMP statiche sui workload AI sono reali, ma DLB ridistribuisce i flowlet in base alla congestione locale in finestre inferiori al millisecondo, e GLB in OcNOS 7.1 estende questo al path scoring end-to-end.
Trasporto adatto al packet spray
Ultra Ethernet (UEC 1.0, giugno 2025) porta packet spray, RDMA multi-path e consegna out-of-order all'Ethernet standard. Costruite su RoCEv2 ora e mantenete un percorso pulito verso UEC man mano che arrivano le NIC.
La rete è una voce di costo contenuta, quindi concentrate il confronto su ciò che libera
Nell'arco di cinque anni il livello di switching rappresenta una percentuale a una cifra del TCO del cluster, che cresce una volta conteggiati NIC, ottiche e cablaggio. La domanda utile non è la voce di costo, ma cosa finanzia il capitale risparmiato.
- A parità di capacità, InfiniBand single-vendor comporta un sovrapprezzo rispetto all'Ethernet su hardware aperto.
- Il capitale risparmiato finanzia più GPU, un livello di storage più ampio o una seconda sede per la resilienza.
- Dove il fabric è multi-tenant o condiviso con il resto del data center, un unico modello di rete vale più della differenza di voce di costo.
Entrambi hanno un posto, e la maggior parte dei fabric AI appartiene a Ethernet
Ethernet non vince ogni carico di lavoro, ma il vantaggio operativo ed economico è decisivo per la maggior parte, e si rafforza man mano che il divario tecnico si chiude.
Entrambi hanno un posto
Ethernet non vince ogni carico di lavoro. I cluster HPC compatti con requisiti di latenza a limite assoluto continuano a favorire InfiniBand.
La maggior parte dei fabric AI appartiene a Ethernet
Il training e l'inferenza AI di produzione su scala hyperscale si stanno spostando su Ethernet man mano che il vantaggio operativo ed economico cresce e il divario tecnico continua a chiudersi.
OcNOS-DC è il percorso aperto
RoCEv2 oggi, DLB oggi, GLB in arrivo, UEC quando le NIC saranno disponibili. Un solo NOS, una sola feature roadmap, su hardware aperto validato di Edgecore, UfiSpace e altri.
InfiniBand vs Ethernet, le risposte
Ethernet è abbastanza veloce per l'addestramento AI rispetto a InfiniBand?
In quali casi conviene ancora scegliere InfiniBand?
In quali casi Ethernet risulta vincente per una AI fabric?
In che modo OcNOS riduce il divario con InfiniBand?
Gli hyperscaler stanno sostituendo InfiniBand con Ethernet per l'AI?
Qual è la migliore alternativa a InfiniBand per il networking dei cluster AI?
Qual è la differenza tra Ultra Ethernet e InfiniBand?
Quanto costa un fabric AI Ethernet rispetto a InfiniBand?
Approfondite. Portatelo con voi.
Il datasheet di prodotto e download tecnici e sintetici che vanno oltre questa pagina.
Datasheet OcNOS-DC
Specifica completa di OcNOS-DC: il set di funzionalità EVPN-VXLAN e Ethernet for AI, gli SKU software, le piattaforme hardware supportate e la guida all'ordine della soluzione.
Ottieni il datasheetOcNOS 800G Lossless AI Fabric
Fabric RoCEv2 non bloccante su spine Broadcom Tomahawk 4/5: tier di SKU, piattaforme validate e architettura di deployment.
Scarica il briefEVPN-VXLAN data center fabric
Fabric leaf-spine per data center di livello carrier: IRB simmetrico, route Type-2/Type-5 e gateway anycast distribuito.
Scarica il briefDatasheet OcNOS-DC
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
OcNOS 800G Lossless AI Fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
EVPN-VXLAN data center fabric
Modulo rapido. Il suo PDF si apre in una nuova scheda subito dopo l'invio.
✓ Apertura del suo PDF in una nuova scheda…
Se non si è aperto, utilizzi il link qui sotto.
State dimensionando il vostro prossimo cluster? Ottenete una valutazione specifica per il carico di lavoro
Indicateci il carico di lavoro e la scala di GPU e un ingegnere IP Infusion elaborerà i calcoli con voi, oppure iniziate con un primo layout leaf-spine nell'AI Fabric Design Suite.
Progettate l'intero fabric AI con OcNOS
Dal business case al calcolo del numero di porte, riprendete da qualunque punto della realizzazione.