RoCEv2 · DCQCN · DLB · UEC 1.0 ready

OcNOS AI Fabric: open 800G lossless Ethernet for GPU clusters

OcNOS AI Fabric brings carrier-grade networking to the GPU cluster: a complete lossless Ethernet system. IP Infusion delivers it whole, validated 800G open switches from Edgecore or UfiSpace running OcNOS-DC, supported under one contract, with your NIC, GPU, and switch choices kept open. It carries lossless RoCEv2 RDMA with PFC, ECN-based congestion control (DCQCN), and sub-millisecond DLB in production today. IP InfusionはUltra Ethernet Consortiumの貢献メンバーであり、OcNOS-DCは次に準拠します Ultra Ethernet 1.0 fabric profile.

600+本番運用中の OcNOS ネットワーク
60+サービス提供国数
26 年本番環境で実績のあるルーティングスタック
Multi-
thousand
GPUリファレンスデザイン
The stakes

ジョブ完了時間を左右する要素

スケール時に重要なのは、スイッチのスループットではなく、ジョブがどれだけ速く完了しGPUがどれだけ稼働し続けるか。クラスターが同期のために停止するたびに、アイドル状態のGPUが処理能力を浪費するため、ファブリックは一切パケットを落とさず、輻輳が始まった瞬間に対応する必要がある。

OcNOS-DC exposes every setting, so your team tunes the fabric against your real GPU collective traffic (xCCL: NCCL, RCCL, oneCCL) instead of accepting a vendor's fixed profile. Each pattern below is one way a cluster stalls, and how OcNOS-DC keeps it moving.

学習同期 (AllReduce)
すべての GPU が同時に他のすべての GPU と通信
標準的なロードバランシングではこれらの大きなフローが 1 本のアップリンクに固定されるため、一部のリンクが輻輳する一方で他は遊休状態となり、同期処理は最も遅い経路に律速されます。
DLB 1 ミリ秒未満でフローを負荷の低いパスへと切り替えます。
GLB is on the OcNOS roadmap to balance across the whole fabric, not just the local hop.
結果: トラフィックのホットスポットがなくなり、同期ステップはほぼフル速度で実行されます。
トラフィックバースト (incast)
多数の送信元がマイクロ秒単位で 1 つのポートに集中
パケットが1つ失われると集合通信全体が再開し、過度なポーズはリンクを停止させるため、ファブリックは輻輳を早期に抑え込む必要があります。
DCQCN 何かがあふれる前に、早い段階で送信元を減速させます。
PFC watchdog スタックしたポートを自動的に復旧します。
結果: ジョブはバーストを乗り切り、停滞したポートは手動リセットなしで復旧します。
スケールアウト (マルチレール)
1 つのフローがすべての並列パスを同時に必要とする
現状では 1 つのフローが単一のパスを通り、他のレールは使われないままとなります。
Ultra Ethernet(UEC 1.0) 単一のフローをすべてのパスへ同時に分散します。
→ 今日購入するスイッチは、UEC NIC の登場時にも入れ替えなしでそのまま活用可能です。
結果: UEC NIC の展開が進むにつれ、最も遅い転送が高速化します。
90%+ target

Where the capacity goes. Static ECMP pins each large flow to one path, so elephant flows collide on a few uplinks while others sit idle. Dynamic load balancing rebinds flows on real-time congestion to keep every uplink busy, so a well-run AI fabric targets utilization in the 90% range on the same switches, with no extra uplinks. OcNOS-DC ships DLB on Tomahawk 4 and 5.

DLB 詳細解説 →
Reference topology

800G Spine-Leaf、 エンドツーエンドでロスレス

各チームが熟知するleaf-spine(Clos)設計を、GPUトラフィックを損失なく処理できるよう構築。ルーテッドeBGPアンダーレイがすべての経路にトラフィックを均等分散し、ロスレスな優先度キューがRoCEv2フローを保護、独立した管理ネットワークがスイッチを起動し、テレメトリを単独でストリーミング。チェックポイントおよびデータセット向けのleaf接続NVMe-oFならびにNFSストレージは、GPUラックに隣接して配置。詳細は以下を参照 DC ファブリック for storage-fabric detail. Hover any node for platform, port count, and chip.

AIファブリックトポロジ: 並列リーフを備えた800Gスパインリーフ、フルメッシュeBGP、独立した管理バス、リーフ接続ストレージで構成
AI Fabric: 800Gスパインリーフ、フルメッシュeBGP、独立した管理バス、リーフ接続ストレージ。
Rail-optimized reference design

Every GPU NIC on its own rail, scaling across pods

In a rail-optimized fabric each GPU server homes one NIC to each of eight dedicated rail leaves, so the dominant same-rail AllReduce stays on one leaf and only cross-rail traffic reaches the spine. It scales pod by pod on the same 800G Tomahawk 5 switches. See the rail-optimized deep-dive and the full reference topologies.

Rail-optimized AI fabric topology: four 800G Tomahawk 5 spines above eight rail leaves, with four GPU servers each mapping one of its eight NICs to a different rail leaf, so intra-rail AllReduce stays on one leaf.
Rail-optimized single pod: each GPU server's 8 NICs map one per rail to 8 dedicated leaves, so same-rail AllReduce stays on the leaf and only cross-rail traffic reaches the spine.
ハードウェア

検証済みのオープンスイッチ

OcNOS-DC は Edgecore および UfiSpace の Broadcom Tomahawk/Trident スイッチ上で動作するため、あらゆるプラットフォームが検証済みで、発注可能かつセカンドソース調達可能です。

Edgecore AIS800-64D 800G spine switch
Spine · Tomahawk 5

Edgecore AIS800-64D

64 x 800G · 51.2 Tbps

QSFP-DD800 · 2x400G/4x200G/8x100Gへのブレイクアウト

Datasheet →
UfiSpace S9321-64E 800G spine switch
Spine · Tomahawk 5

UfiSpace S9321-64E

64 x 800G · 51.2 Tbps

QSFP-DD800 · 2x400G/4x200G/8x100Gへのブレイクアウト

Datasheet →
Edgecore AS9736-64D 400G leaf switch
Leaf · Tomahawk 4

Edgecore AS9736-64D

64 x 400G · 25.6 Tbps

QSFP56-DD 400G · 4x100G/4x25Gへのブレイクアウト · DAC/AOC

Datasheet →

HCL で 40 種類以上の検証済みプラットフォームをすべて見る →

Broadcom Tomahawk と Trident の各ファミリーの違い、そして OcNOS が動作するすべてのオープンスイッチ →

ソフトウェア・ハードウェア・サポートを単一ベンダーが担保

単一ベンダーによるサポート

単一の契約、単一の問い合わせ先チーム

IP Infusion との単一の契約で OcNOS-DC ソフトウェアと検証済みのスイッチハードウェアを一括してカバーするため、NOS ベンダーとハードウェアベンダーが分かれることなく、TAC も SLA も一本化されます。Premium および Enterprise ティアでは 24/7 のサポートポータルを利用可能です。

サポート詳細を見る
IP MAESTRO MANAGEMENT

ファブリックを一元管理する単一コンソール

IP Maestro は OcNOS 向けのエレメント管理システムです: NETCONF を介して全スイッチのトポロジー、障害、コンフィグレーション、ソフトウェアイメージを扱い、既存の OSS の下位に位置します。大規模なマルチサイトのフリートを一つのコンソールから管理します。

IP Maestro を見る
AUTOMATED DAY 2

ストリーミングテレメトリとゼロタッチ

gNMI ストリーミングテレメトリが Prometheus と Grafana にデータを供給し、DCBX が各サーバーへ正しいロスレス設定を自動的にプッシュし、ゼロタッチプロビジョニングが起動時に構成済みの状態でスイッチを立ち上げます。

自動化を試す
Spectrum-Xに代わるオープンな選択肢

NVIDIA Spectrum-X に対する、オープンでマルチベンダーの代替

OcNOS-DC は、複数のオープンハードウェアベンダーによる標準 Ethernet スイッチ上で、ロスレス RoCEv2 の AI ファブリックを一つのサポート契約で稼働させます。AI トレーニングジョブが依存するファブリックメカニズムに対応しつつ、NIC、GPU、ハードウェアの選択を単一ベンダーに固定せずオープンに保ちます。

OcNOS-DC上のオープンAIファブリックと、クローズドな単一ベンダーAIスタックの比較。最終検証: 2026年7月。
商談を左右する要素 オープンAIファブリック(Edgecore/UfiSpace上のOcNOS-DC) クローズドな単一ベンダースタック(NVIDIA Spectrum-X)
ハードウェア調達 複数ベンダーによるオープンなマーチャントシリコン(Edgecore、UfiSpace) シングルベンダーのスイッチ、NIC、GPU
NIC および GPU の選択 オープン。NICとGPUを個別に交換可能 NVIDIA NICおよびGPUロードマップと連携
ロスレス RoCEv2 (PFC、ECN、DCQCN) details →
アダプティブロードバランシング sub-millisecond DLB flowlet rebinding details → (proprietary)
PFCデッドロック保護 deadlock watchdog with auto-drain details →
Ultra Ethernet(UEC 1.0) tracks the UEC 1.0 fabric profile details → Aligned; also a UEC contributing member
ストリーミングテレメトリと自動化 gNMI, OpenConfig, ZTP, DCBX, Ansible (vendor pipeline)
単一のサポート契約(スイッチとソフトウェア) 1 つの TAC、1 つの SLA (single vendor)
GPUシリコンバックエンド統合 標準の Ethernet。GPU シリコンとのコデザインなし Advantage NVIDIA: NIC, switch, and GPU co-designed
ファブリックコントローラー層 gNMI テレメトリと、既存の OSS または IP Maestro を通じて管理 Advantage NVIDIA: integrated fabric-controller layer
UEC certification UEC 1.0ファブリックプロファイルに準拠(認証の主張ではありません) NVIDIA は UEC のステアリングメンバーです

NVIDIA、Spectrum-X、Quantum、ConnectX は NVIDIA Corporation の商標です。IP Infusion は NVIDIA と提携しておらず、推奨もしていません。この比較は次で検証可能な OcNOS-DC の機能を反映しています: フィーチャーマトリクス.

2026年のAIファブリックの全体像

OcNOS-DCの位置づけ

2026年までにほぼすべての選択肢が、同じ技術的水準をクリアします:ロスレスRoCEv2、輻輳制御、アダプティブルーティング、Ultra Ethernet準拠。したがって判断は、次に集約されます 取引の形態:オープンなオペレーティングシステムかロックされたスタックか、オープンなハードウェアかロックされたハードウェアか、標準の Ethernet か閉じた InfiniBand か。 Here is where each one leaves you.

ソリューション形態 トレードオフ
Open NOS、AI 向けに強化、UEC 準拠 Edgecore / UfiSpace 上の OcNOS-DC 同一の Broadcom シリコン、同一の技術的水準。RDMA コレクティブトラフィック向けにチューニングされた DCQCN、ミリ秒未満の DLB、OcNOS ロードマップ上の GLB、PFC デッドロックウォッチドッグ、UEC 1.0 ファブリックプロファイル。シングルベンダーサポート。NIC、GPU、ハードウェアのロックインなし。
垂直統合型クローズド AI スタック NVIDIA Spectrum-X + Quantum + ConnectX 統合された性能は非常に優れています。NIC、スイッチ、ファブリックソフトウェアが単一ベンダ、および単一の GPU ロードマップ、に固定されます。
ロックインされた Merchant Silicon NOS Arista EOS · Cisco NX-OS · Juniper Junos 下層には同じ Broadcom シリコンを採用しています。ポート単位のライセンスプレミアムが課されます。テレメトリおよびチューニングはベンダ独自のパイプラインに制約されます。
セルベースの独自シャーシ Fabric DriveNets Network Cloud 異なるアーキテクチャです:Ethernet NOS ではなく、スケジュールド型のセルファブリックです。ハイパースケールに強い一方、標準的なスイッチへの移植性はありません。
Closed-Loop InfiniBand NVIDIA Quantum InfiniBand 現時点で緊密な collective 向けに最も低いレイテンシを実現します。ただしケーブリングも運用も別立てで、単一ベンダーのエコシステムです。UEC が Ethernet 側との差を埋めていきます。
Open NOS、AI 向け強化なし コミュニティSONiC オープンなハードウェア、フリーソフトウェア、SLAなし。RDMA向けにチューニングされたDCQCNデフォルト、デッドロックウォッチドッグ、チューニングの成熟度は、すべてオペレーター任せ。

各選択肢はそれぞれ異なる優先事項に対応します。OcNOS-DC は、オープンなハードウェア・完全なソリューション・ロックインの排除を強みとします。

AI Fabric サイジングガイド

GPU ファブリックを数分でサイジング

GPU 数と NIC 速度を入力してください。AI Fabric Design Suite が、leaf-spine トポロジー・スイッチおよびポート数・そのまま見積もりに使える部品表 (BOM) へと対応付けます。スプレッドシートは不要です。

よくある質問

よくあるご質問

OcNOS-DC は本当に "AI ネイティブ" なのか、それとも単に RoCEv2 にいくつか機能を加えただけなのか。
マーチャントシリコンの Ethernet NOS で文字どおり AI ネイティブなものは存在しません。xCCL (NCCL / RCCL / oneCCL) の集合通信を解釈したり、スイッチでジョブをスケジュールしたりするものはなく、それは NIC とスケジューラの領域です。OcNOS-DC は、2026 年の AI ワークロードが必要とするすべてのファブリックメカニズムを実装します: ロスレス RoCEv2、RDMA 集合通信のトラフィックパターン向けに調整された DCQCN バッファプロファイル、ミリ秒未満の DLB フローレット再バインド、PFC デッドロックウォッチドッグ、UEC 1.0 準拠。そして上位レイヤーには踏み込みません。「AI アウェアなファブリック」とは、たいてい一つのベンダーが NIC + スイッチ + スケジューラをロックされた一つの SKU として販売することを意味するにすぎません。
OcNOS-DC の責務はどこまでで、NIC とクラスタスケジューラはどこから引き継ぐのですか。
OcNOS-DC が担うのはレイヤ 1 です:ロスレス RDMA トランスポート、輻輳制御、適応型ルーティング、デッドロックリカバリ、テレメトリ。NIC はレイヤ 2 (xCCL、RDMA verbs、パケットスプレー、GPU ダイレクトメモリ) を担い、スケジューラはレイヤ 3 (ジョブ配置、勾配同期ウィンドウ、テナント分離) を担います。OcNOS-DC は gNMI テレメトリをレイヤ 3 へストリーミングしますが、スケジューラ自体になろうとはしません。この分離によって、NIC、GPU、オーケストレーションのいずれも入れ替え可能な状態が保たれます。
OcNOS AI Fabric は、NVIDIA Spectrum-X、SONiC、Arista、Cisco、DriveNets とどのように比較されますか?
Spectrum-X is a closed NVIDIA NIC + switch + software stack: excellent performance, single-vendor lock-in. Arista, Cisco, and Juniper run similar RoCEv2 features on locked hardware with proprietary licensing. Community SONiC is open but ships no AI-hardened defaults, watchdog, or SLA. DriveNets DDC is a proprietary cell fabric, not an Ethernet NOS. OcNOS-DC delivers the complete system, validated open switches plus OcNOS-DC plus support under one contract, and runs one NOS across both service-provider and data-center roles. It runs on Broadcom silicon with lossless RoCEv2 (PFC, ECN, sub-millisecond DLB with Reactive Path Rebalance), PFC deadlock recovery, UEC 1.0 fabric-profile alignment, and a 24/7 SLA, with no lock-in.
Ultra Ethernet (UEC) 1.0 は OcNOS AI ファブリックにとって何を意味するのか。
現在購入するスイッチは、Ultra Ethernet NIC が登場した際にも引き続き活用できるべきであり、OcNOS-DC ではそれが実現します。各ファブリックは、現時点で完全にサポートされた RoCEv2 に加え DCQCN と DLB を本番環境で実行し、OcNOS-DC は UEC 1.0 ファブリックプロファイルを追随します。これは、各フローを 1 つの ECMP ハッシュに固定する代わりにすべてのパスにわたって並列化するため、NOS やハードウェアの交換なしで UEC NIC へ移行可能。OcNOS-DC は UEC 1.0 ファブリックプロファイルに準拠していますが、準拠は認証を主張するものではありません。次をご覧ください: Ultra Ethernet 詳細解説.
RoCEv2 とは何か、なぜロスレスイーサネットファブリックが必要なのか?
トレーニングの集団通信であるAllReduceとAllGatherは、経路上にCPUを介さずRoCEv2でGPU間のデータを移動し、RDMAは再送を行わないため、パケットが1つでもドロップするとジョブ内のすべてのGPUで処理が再開。だからこそ本番運用のRoCEv2には真にロスレスなファブリック(PFCとECN)が必要であり、OcNOS-DCはRDMA集団通信トラフィック向けにチューニングされたRoCEv2バッファプロファイルとDCQCNデフォルトを標準搭載。各チームがそのロスレス挙動をゼロから構築する必要はありません。
How does OcNOS-DC keep the fabric lossless, and what protects against PFC deadlock?
メカニズムは三つあります。PFC はバッファがオーバーフローする前に優先度ごとにトラフィックを一時停止します。ECN は早期にパケットへマーキングを行って送信側を減速させます。ETS は RDMA フローを低優先度トラフィックの前に維持します。そのうえに、ポート単位かつ優先度単位のデッドロックウォッチドッグが、停止状態のキューサイクルを検出し、ジョブがハングする前にキューを自動的にドレインします:これは従来、ジョブの途中でスイッチの電源再投入を強いてきた障害モードです。PFC over L3 はルーティング境界を越えてサポートされます。
DLBとは何か、そしてOcNOSロードマップ上のGLBとは何か。
AllReduceの際、標準のECMPが各フローをその存続期間中は単一のアップリンクに固定するため最大級のフロー同士が衝突し、同期は詰まったリンクを待つことになります。DLBはASICのキュー深度テレメトリをリアルタイムで読み取り、1ミリ秒未満でフローレットを負荷の低いパスへ再バインドするため、ローカルホップで失われたスループットを現在すでに回復します。GLBは同じ考え方をファブリック全体へ拡張するものとしてOcNOS 7.xのロードマップに位置づけられており、スパインが経路品質テレメトリを入口リーフへ公開することで、ルーティングが数千GPU規模の大規模クラスター全体にわたるマルチホップ経路全体をスコアリングします。
OcNOS AI Fabric はどのような規模をサポートしますか、そして検証済みのリファレンスデザインはどのようなものですか?
OcNOS-DC は 400G および 800G のリーフ・スパインファブリックをサポートします。 Tomahawk 5 スパイン (Edgecore AIS800-64D、UfiSpace S9321-64E) は 51.2 Tbps / 64 × 800G を実現。 Tomahawk 4 leaves run 400G / 25.6 Tbps with on-chip buffering; Trident 4 covers smaller 100G/400G fabrics. Reference designs cover rail-only, rail-optimized, and 3-stage Clos topologies for large multi-thousand-GPU clusters: see the AI Fabric トポロジー詳細解説.
OcNOS-DC は AI ファブリック運用向けの自動化とテレメトリに対応しているのか?
はい。DCBXはサーバー間・スイッチ間のRoCEv2設定を自動化し、ZTP(IPv4/IPv6)がゼロタッチのオンボーディングを処理、gNMIがOpenConfig YANG上でオンチェンジテレメトリをストリーミング。PFCポーズ、ECNマーキング、DCQCNしきい値、バッファ深度はgNMIセンサーパスであり、Prometheus、InfluxDB、Telegraf、Grafana、あるいは任意のOpenTelemetryパイプラインで利用可能。AnsibleプレイブックはDay-0からDay-2までをカバーし、Terraformプロバイダーもロードマップに掲載。OcNOS向けのエレメント管理システムであるIP Maestroは、NETCONF経由でトポロジー、障害、構成、ソフトウェアイメージを管理し、大規模なマルチサイトのフリートを1つのコンソールから管理。
OcNOS AI ファブリックが対応するスイッチハードウェアと 800G 光モジュールは何ですか。
The fabric runs on validated Broadcom Tomahawk 4 and 5 switches from Edgecore and UfiSpace. The 800G spines (Edgecore AIS800-64D and UfiSpace S9321-64E, Tomahawk 5, 64 x 800G QSFP-DD800, 51.2 Tbps) break out to 400G, 200G, and 100G; the 400G leaf (Edgecore AS9736-64D, Tomahawk 4, 64 x 400G QSFP56-DD, 25.6 Tbps with on-chip buffering) breaks out to 100G and 25G. Optics have proven interoperability from multiple vendors, so contact us for the transceiver list for your build. The switch platforms are listed in the HCL.
AI ファブリックのサポートは誰が提供し、ハードウェアも対象に含まれますか。
IP Infusion との単一の契約で OcNOS-DC ソフトウェアと検証済みのスイッチハードウェアを一括してカバーするため、TAC も SLA も一本化されます。サポートはティア制です。Standard はメール TAC・営業時間内の電話サポート・ハードウェア RMA 調整を含み、P1 対応は 8 時間です。Premium はこれに 24/7 のカスタマーサポートポータルと 2 時間の P1 対応を追加します。Enterprise はさらに 30 分の P1 対応とカスタマーサクセスマネージャーを追加します。24/7 ポータルは Premium および Enterprise で利用可能です。