RoCEv2・DCQCN・DLB・800G

OcNOS AI Fabric:GPU クラスター向けのオープンな 800G ロスレスイーサネット

OcNOS AI Fabric は、キャリアグレードのネットワーキングを GPU クラスターにもたらす、完全なロスレスイーサネットシステムです。IP Infusion はこれを OcNOS Systems として一括で提供します。Edgecore または UfiSpace の検証済み 800G オープンスイッチで OcNOS-DC を稼働させ、1 つのサポート契約のもと、NIC、GPU、スイッチの選択肢をオープンに保ちます。PFC、ECN ベースの輻輳制御(DCQCN)、ミリ秒未満の DLB によるロスレス RoCEv2 RDMA を、現在すでに本番環境で運用しています。IP Infusion は Ultra Ethernet Consortium のメンバーです。

600+本番運用中の OcNOS ネットワーク
60+サービス提供国数
1999 年から本番環境で実績のあるルーティングスタック
数千規模GPUリファレンスデザイン
アーキテクチャブリーフ

アーキテクチャブリーフをダウンロード

このページより踏み込んだ 4 つの短い資料:ロスレス AI ファブリックのアーキテクチャ、OcNOS-DC の完全なデータシート、EVPN-VXLAN データセンターのリファレンス、IPoDWDM による次世代 DCI。

影響の大きさ

ジョブ完了時間を左右する要素

スケール時に重要なのは、スイッチのスループットではなく、ジョブがどれだけ速く完了しGPUがどれだけ稼働し続けるか。クラスターが同期のために停止するたびに、アイドル状態のGPUが処理能力を浪費するため、ファブリックは一切パケットを落とさず、輻輳が始まった瞬間に対応する必要がある。

OcNOS-DC はすべての設定を公開しているため、ベンダーの固定プロファイルを受け入れるのではなく、実際の GPU 集合通信トラフィック(xCCL:NCCL、RCCL、oneCCL)に合わせて各チームがファブリックをチューニングできます。以下の各パターンは、クラスターが停滞する要因の 1 つと、OcNOS-DC がそれを解消する方法を示しています。

すべての GPU が同時に他のすべての GPU と通信
標準的なロードバランシングではこれらの大きなフローが 1 本のアップリンクに固定されるため、一部のリンクが輻輳する一方で他は遊休状態となり、同期処理は最も遅い経路に律速されます。
→ DLB 1 ミリ秒未満でフローを負荷の低いパスへと切り替えます。
→ GLB は、ローカルホップだけでなくファブリック全体で負荷分散を行うために OcNOS のロードマップに含まれています。
結果: トラフィックのホットスポットがなくなり、同期ステップはほぼフル速度で実行されます。
学習同期 (AllReduce)
多数の送信元がマイクロ秒単位で 1 つのポートに集中
パケットが1つ失われると集合通信全体が再開し、過度なポーズはリンクを停止させるため、ファブリックは輻輳を早期に抑え込む必要があります。
→ DCQCN 何かがあふれる前に、早い段階で送信元を減速させます。
→ PFC ウォッチドッグ スタックしたポートを自動的に復旧します。
結果: ジョブはバーストを乗り切り、停滞したポートは手動リセットなしで復旧します。
トラフィックバースト (incast)
1 つのフローがすべての並列パスを同時に必要とする
現状では 1 つのフローがハッシュで決まる単一のパスを通り、他のレールは使われないままとなります。
→ DLB は、現在運用している RoCEv2 ファブリック上で、混雑したパスからフローレットを移動させます。
→ Ultra Ethernet(UEC) は、UEC 対応 NIC から 1 つのフローを多数のパスに分散するマルチパストランスポートです。
結果: 現在はすべてのレールをより有効に活用でき、UEC NIC の展開が進めば標準のマルチパストランスポートも利用できます。
スケールアウト (マルチレール)
目標 90% 以上

容量の行き先。 静的 ECMP は大きなフローをそれぞれ 1 つのパスに固定するため、エレファントフローが一部のアップリンクに集中し、他のアップリンクは遊休状態になります。動的ロードバランシングはリアルタイムの輻輳に応じてフローを再割り当てしてすべてのアップリンクを活用するため、適切に運用された AI ファブリックは、アップリンクを追加せずに同じスイッチで 90% 台の使用率を目標にできます。OcNOS-DC は Tomahawk 4 と 5 で DLB を提供します。

DLB 詳細解説 →
リファレンストポロジー

800G スパイン・リーフ、 エンドツーエンドでロスレス

各チームが熟知するleaf-spine(Clos)設計を、GPUトラフィックを損失なく処理できるよう構築。ルーテッドeBGPアンダーレイがすべての経路にトラフィックを均等分散し、ロスレスな優先度キューがRoCEv2フローを保護、独立した管理ネットワークがスイッチを起動し、テレメトリを単独でストリーミング。チェックポイントおよびデータセット向けのleaf接続NVMe-oFならびにNFSストレージは、GPUラックに隣接して配置。詳細は以下を参照 DC ファブリック でストレージファブリックの詳細をご確認ください。各ノードにカーソルを合わせると、プラットフォーム、ポート数、チップが表示されます。

AIファブリックトポロジ: 並列リーフを備えた800Gスパインリーフ、フルメッシュeBGP、独立した管理バス、リーフ接続ストレージで構成
AI Fabric: 800Gスパインリーフ、フルメッシュeBGP、独立した管理バス、リーフ接続ストレージ。
レール最適化リファレンスデザイン

各 GPU NIC を専用レールに配置し、ポッド単位でスケール

レール最適化ファブリックでは、各 GPU サーバーが 8 台の専用レールリーフのそれぞれに NIC を 1 つずつ接続するため、大半を占める同一レールの AllReduce は 1 台のリーフ内にとどまり、レールをまたぐトラフィックだけがスパインに到達します。同じ 800G Tomahawk 5 スイッチでポッド単位にスケールします。詳しくは レール最適化の詳細解説 と、すべての リファレンストポロジー.

レール最適化 AI ファブリックトポロジー:8 台のレールリーフの上位に 4 台の 800G Tomahawk 5 スパインを配置し、4 台の GPU サーバーがそれぞれ 8 つの NIC を別々のレールリーフに 1 つずつ対応させるため、レール内の AllReduce は 1 台のリーフ内にとどまります。
レール最適化シングルポッド:各 GPU サーバーの 8 つの NIC がレールごとに 1 つずつ 8 台の専用リーフに対応するため、同一レールの AllReduce はリーフ内にとどまり、レールをまたぐトラフィックだけがスパインに到達します。
ハードウェア

検証済みのオープンスイッチ

OcNOS-DC は Edgecore および UfiSpace の Broadcom Tomahawk/Trident スイッチ上で動作するため、あらゆるプラットフォームが検証済みで、発注可能かつセカンドソース調達可能です。

Edgecore AIS800-64D 800G スパインスイッチ

Edgecore AIS800-64D

64 x 800G · 51.2 Tbps

QSFP-DD800 · 2x400G/4x200G/8x100Gへのブレイクアウト

スパイン · Tomahawk 5
データシート →
UfiSpace S9321-64E 800G スパインスイッチ

UfiSpace S9321-64E

64 x 800G · 51.2 Tbps

QSFP-DD800 · 2x400G/4x200G/8x100Gへのブレイクアウト

スパイン · Tomahawk 5
データシート →
Edgecore AS9736-64D 400G リーフスイッチ

Edgecore AS9736-64D

64 x 400G · 25.6 Tbps

QSFP56-DD 400G · 4x100G/4x25Gへのブレイクアウト · DAC/AOC

リーフ · Tomahawk 4
データシート →

HCL で 40 種類以上の検証済みプラットフォームをすべて見る →

Broadcom Tomahawk と Trident の各ファミリーの違い、そして OcNOS が動作するすべてのオープンスイッチ →

OcNOS Systems:ソフトウェア・ハードウェア・サポートを単一ベンダーが担保

単一の契約、単一の問い合わせ先チーム

OcNOS Systems として購入した場合、ファブリックは IP Infusion との単一の契約で OcNOS-DC ソフトウェアと検証済みのスイッチハードウェアを一括してカバーするため、NOS ベンダーとハードウェアベンダーが分かれることなく、TAC も SLA も一本化されます。Premium および Enterprise ティアでは 24/7 のサポートポータルを利用可能です。

サポート詳細を見る

ファブリックを一元管理する単一コンソール

IP Maestro は OcNOS 向けのエレメント管理システムです: NETCONF を介して全スイッチのトポロジー、障害、コンフィグレーション、ソフトウェアイメージを扱い、既存の OSS の下位に位置します。大規模なマルチサイトのフリートを一つのコンソールから管理します。

IP Maestro を見る

ストリーミングテレメトリとゼロタッチ

gNMI ストリーミングテレメトリが Prometheus と Grafana にデータを供給し、DCBX が各サーバーへ正しいロスレス設定を自動的にプッシュし、ゼロタッチプロビジョニングが起動時に構成済みの状態でスイッチを立ち上げます。

自動化を試す
Spectrum-Xに代わるオープンな選択肢

NVIDIA Spectrum-X に対する、オープンでマルチベンダーの代替

OcNOS-DC は、複数のオープンハードウェアベンダーによる標準 Ethernet スイッチ上でロスレス RoCEv2 の AI ファブリックを稼働させ、OcNOS Systems として購入した場合は一つのサポート契約で対応します。AI トレーニングジョブが依存するファブリックメカニズムに対応しつつ、NIC、GPU、ハードウェアの選択を単一ベンダーに固定せずオープンに保ちます。

OcNOS-DC上のオープンAIファブリックと、クローズドな単一ベンダーAIスタックの比較。最終検証: 2026年7月。
商談を左右する要素 オープンAIファブリック(Edgecore/UfiSpace上のOcNOS-DC) クローズドな NIC とスイッチの一体型スタック
ハードウェア調達 複数ベンダーによるオープンなマーチャントシリコン(Edgecore、UfiSpace) シングルベンダーのスイッチ、NIC、GPU
NIC および GPU の選択 オープン。NICとGPUを個別に交換可能 NIC と GPU のロードマップが単一ベンダーに依存
ロスレス RoCEv2 (PFC、ECN、DCQCN) ✓ 詳細 → ✓
アダプティブロードバランシング ✓ ミリ秒未満の DLB フローレット再割り当て 詳細 → ✓ (独自仕様)
PFCデッドロック保護 ✓ 自動ドレイン付きデッドロックウォッチドッグ 詳細 → ✓
ストリーミングテレメトリと自動化 ✓ gNMI, OpenConfig, ZTP, DCBX, Ansible ✓ (ベンダーのパイプライン)
単一のサポート契約(スイッチとソフトウェア) ✓ OcNOS Systems なら 1 つの TAC、1 つの SLA ✓ (単一ベンダー)
GPUシリコンバックエンド統合 標準の Ethernet。GPU シリコンとのコデザインなし NIC、スイッチ、GPU を単一ベンダーが協調設計
ファブリックコントローラー層 gNMI テレメトリと、既存の OSS または IP Maestro を通じて管理 ベンダー統合型のファブリックコントローラー層

NVIDIA および Spectrum-X は NVIDIA Corporation の商標です。IP Infusion は NVIDIA と提携しておらず、NVIDIA を推奨するものでもありません。この比較は、次で確認できる OcNOS-DC の機能に基づいています: フィーチャーマトリクス.

2026年のAIファブリックの全体像

OcNOS-DCの位置づけ

OcNOS-DC は、2026 年の AI ファブリックの選択肢の多くが共有する技術的水準を満たしています:ロスレス RoCEv2、輻輳制御、アダプティブルーティング。したがって判断は、次に集約されます 取引の形態:オープンなオペレーティングシステムかロックされたスタックか、オープンなハードウェアかロックされたハードウェアか、標準の Ethernet か閉じた InfiniBand か。 Here is where each one leaves you.

ソリューション形態 概要 トレードオフ
オープン NOS、AI 向けに強化 Edgecore / UfiSpace 上の OcNOS-DC 同一の Broadcom シリコン、同一の技術的水準。RDMA 集合通信トラフィック向けにチューニングされた DCQCN、ミリ秒未満の DLB、OcNOS ロードマップ上の GLB、PFC デッドロックウォッチドッグ。OcNOS Systems なら 1 つのサポート契約。NIC、GPU、ハードウェアのロックインなし。
垂直統合型クローズド AI スタック NIC、スイッチ、ファブリックソフトウェアを単一ベンダーから NIC、スイッチ、ファブリックソフトウェアが統合され、単一ベンダーと単一の GPU ロードマップに固定されます。
独自ハードウェア型 NOS そのベンダーのスイッチでのみ販売されるベンダー NOS 多くの場合、下層は同じマーチャントシリコン。ポート単位ライセンスによる割高なコスト。テレメトリとチューニングはベンダー独自のパイプラインに制約されます。
セルベースの独自シャーシ Fabric 独自シャーシソフトウェア上のスケジュールド型セルファブリック 異なるアーキテクチャです:Ethernet NOS ではなく、スケジュールド型のセルファブリックです。標準的なスイッチへの移植性はありません。
クローズド InfiniBand Ethernet とは別系統の InfiniBand NIC とスイッチ 密結合の集合通信向けの低レイテンシ。ただしケーブリングも運用も別立てで、単一ベンダーのエコシステムです。
Open NOS、AI 向け強化なし コミュニティのオープンソース NOS ディストリビューション オープンなハードウェア、フリーソフトウェア、SLAなし。RDMA向けにチューニングされたDCQCNデフォルト、デッドロックウォッチドッグ、チューニングの成熟度は、すべてオペレーター任せ。

各選択肢はそれぞれ異なる優先事項に対応します。OcNOS-DC は、オープンなハードウェア・完全なソリューション・ロックインの排除を強みとします。

AI Fabric サイジングガイド

GPU ファブリックを数分でサイジング

GPU 数と NIC 速度を入力してください。AI Fabric Design Suite が、leaf-spine トポロジー・スイッチおよびポート数・そのまま見積もりに使える部品表 (BOM) へと対応付けます。スプレッドシートは不要です。

よくある質問

よくあるご質問

OcNOS-DC は本当に "AI ネイティブ" なのか、それとも単に RoCEv2 にいくつか機能を加えただけなのか。
マーチャントシリコンの Ethernet NOS で文字どおり AI ネイティブなものは存在しません。xCCL (NCCL/RCCL/oneCCL) の集合通信を解釈したり、スイッチでジョブをスケジュールしたりするものはなく、それは NIC とスケジューラの領域です。OcNOS-DC は、2026 年の AI ワークロードが必要とするすべてのファブリックメカニズムを実装します:ロスレス RoCEv2、RDMA 集合通信のトラフィックパターン向けに調整された DCQCN バッファプロファイル、ミリ秒未満の DLB フローレット再バインド、PFC デッドロックウォッチドッグ。そして上位レイヤーには踏み込みません。「AI アウェアなファブリック」とは、たいてい一つのベンダーが NIC + スイッチ + スケジューラをロックされた一つの SKU として販売することを意味するにすぎません。
OcNOS-DC の責務はどこまでで、NIC とクラスタスケジューラはどこから引き継ぐのですか。
OcNOS-DC が担うのはレイヤ 1 です:ロスレス RDMA トランスポート、輻輳制御、適応型ルーティング、デッドロックリカバリ、テレメトリ。NIC はレイヤ 2 (xCCL、RDMA verbs、パケットスプレー、GPU ダイレクトメモリ) を担い、スケジューラはレイヤ 3 (ジョブ配置、勾配同期ウィンドウ、テナント分離) を担います。OcNOS-DC は gNMI テレメトリをレイヤ 3 へストリーミングしますが、スケジューラ自体になろうとはしません。この分離によって、NIC、GPU、オーケストレーションのいずれも入れ替え可能な状態が保たれます。
OcNOS AI Fabric は、NVIDIA Spectrum-X、SONiC、Arista、Cisco、DriveNets とどのように比較されますか?
OcNOS-DC は完全な AI ファブリックを提供します。検証済みのオープンスイッチと OcNOS-DC を、サービスプロバイダーネットワークを運用しているのと同じ OcNOS ファミリーから、1 つのサポート契約のもと OcNOS Systems として提供します。Broadcom シリコン上で、ロスレス RoCEv2(PFC、ECN、Reactive Path Rebalance を備えたミリ秒未満の DLB)、PFC デッドロックリカバリ、Premium および Enterprise ティアでの 24/7 サポートを提供し、NIC、GPU、ハードウェアのロックインはありません。他の選択肢は、取引の形が異なります。クローズドな NIC とスイッチの一体型スタックは、NIC、スイッチ、GPU ロードマップのすべてでファブリックを 1 社のベンダーに縛ります。独自ハードウェア型 NOS は、同様の RoCEv2 機能をロックされたハードウェア上でポート単位のライセンスにより提供します。コミュニティのオープンソース NOS ディストリビューションは、AI 向けに調整された初期設定、デッドロックウォッチドッグ、SLA をオペレーター任せにします。セルベースのシャーシファブリックは、標準のイーサネット NOS ではなく、スケジュールされたセルアーキテクチャを使用します。
Ultra Ethernet (UEC) 1.0 は OcNOS AI ファブリックにとって何を意味するのか。
OcNOS-DC は、DCQCN とミリ秒未満の DLB によるロスレス RoCEv2 を現在すでに本番環境で稼働させており、IP Infusion は Ultra Ethernet Consortium(UEC)のメンバーです。UEC 1.0 は、1 つのフローを単一の ECMP ハッシュに固定するのではなく多数のパスに分散するマルチパスのイーサネットトランスポートを定義しており、そのエンドポイント動作は UEC 対応 NIC 上で実行されます。特定の構成に UEC をどう組み込むかは IP Infusion のエンジニアにご相談いただき、Ultra Ethernet の詳細解説もご覧ください。
RoCEv2 とは何か、なぜロスレスイーサネットファブリックが必要なのか?
トレーニングの集団通信であるAllReduceとAllGatherは、経路上にCPUを介さずRoCEv2でGPU間のデータを移動し、RDMAは再送を行わないため、パケットが1つでもドロップするとジョブ内のすべてのGPUで処理が再開。だからこそ本番運用のRoCEv2には真にロスレスなファブリック(PFCとECN)が必要であり、OcNOS-DCはRDMA集団通信トラフィック向けにチューニングされたRoCEv2バッファプロファイルとDCQCNデフォルトを標準搭載。各チームがそのロスレス挙動をゼロから構築する必要はありません。
OcNOS-DC はどのようにファブリックをロスレスに保ち、何が PFC デッドロックを防ぐのですか?
メカニズムは三つあります。PFC はバッファがオーバーフローする前に優先度ごとにトラフィックを一時停止します。ECN は早期にパケットへマーキングを行って送信側を減速させます。ETS は RDMA フローを低優先度トラフィックの前に維持します。そのうえに、ポート単位かつ優先度単位のデッドロックウォッチドッグが、停止状態のキューサイクルを検出し、ジョブがハングする前にキューを自動的にドレインします:これは従来、ジョブの途中でスイッチの電源再投入を強いてきた障害モードです。PFC over L3 はルーティング境界を越えてサポートされます。
DLBとは何か、そしてOcNOSロードマップ上のGLBとは何か。
AllReduceの際、標準のECMPが各フローをその存続期間中は単一のアップリンクに固定するため最大級のフロー同士が衝突し、同期は詰まったリンクを待つことになります。DLBはASICのキュー深度テレメトリをリアルタイムで読み取り、1ミリ秒未満でフローレットを負荷の低いパスへ再バインドするため、ローカルホップで失われたスループットを現在すでに回復します。GLBは同じ考え方をファブリック全体へ拡張するものとしてOcNOS 7.xのロードマップに位置づけられており、スパインが経路品質テレメトリを入口リーフへ公開することで、ルーティングが数千GPU規模の大規模クラスター全体にわたるマルチホップ経路全体をスコアリングします。
OcNOS AI Fabric はどのような規模をサポートしますか、そして検証済みのリファレンスデザインはどのようなものですか?
OcNOS-DC は 400G および 800G のリーフ・スパインファブリックをサポートします。 Tomahawk 5 スパイン (Edgecore AIS800-64D、UfiSpace S9321-64E) は 51.2 Tbps / 64 × 800G を実現。 Tomahawk 4 リーフは 400G / 25.6 Tbps で動作し、オンチップバッファリングを備えます。 Trident 4 はより小規模な 100G/400G ファブリックをカバーします。リファレンスデザインは、数千 GPU 規模の大規模クラスター向けに、レールオンリー、レール最適化、3 段 Clos のトポロジーをカバーしています。詳しくは次をご覧ください: AI Fabric トポロジー詳細解説.
OcNOS-DC は AI ファブリック運用向けの自動化とテレメトリに対応しているのか?
はい。DCBXはサーバー間・スイッチ間のRoCEv2設定を自動化し、ZTP(IPv4/IPv6)がゼロタッチのオンボーディングを処理、gNMIがOpenConfig YANG上でオンチェンジテレメトリをストリーミング。PFCポーズ、ECNマーキング、DCQCNしきい値、バッファ深度はgNMIセンサーパスであり、Prometheus、InfluxDB、Telegraf、Grafana、あるいは任意のOpenTelemetryパイプラインで利用可能。AnsibleプレイブックはDay-0からDay-2までをカバーし、Terraformプロバイダーもロードマップに掲載。OcNOS向けのエレメント管理システムであるIP Maestroは、NETCONF経由でトポロジー、障害、構成、ソフトウェアイメージを管理し、大規模なマルチサイトのフリートを1つのコンソールから管理。
OcNOS AI ファブリックが対応するスイッチハードウェアと 800G 光モジュールは何ですか。
ファブリックは、Edgecore と UfiSpace の検証済み Broadcom Tomahawk 4 および 5 スイッチで稼働します。800G スパイン(Edgecore AIS800-64D と UfiSpace S9321-64E、Tomahawk 5、64 x 800G QSFP-DD800、51.2 Tbps)は 400G、200G、100G にブレイクアウトでき、400G リーフ(Edgecore AS9736-64D、Tomahawk 4、64 x 400G QSFP56-DD、オンチップバッファリング付き 25.6 Tbps)は 100G と 25G にブレイクアウトできます。光モジュールは複数ベンダーとの相互運用性が実証済みのため、構成に合わせたトランシーバーの一覧はお問い合わせください。スイッチプラットフォームは HCL に掲載されています。
AI ファブリックのサポートは誰が提供し、ハードウェアも対象に含まれますか。
ファブリックを OcNOS Systems として購入した場合、IP Infusion との単一の契約で OcNOS-DC ソフトウェアと検証済みのスイッチハードウェアを一括してカバーするため、TAC も SLA も一本化されます。サポートはティア制です。Standard はメール TAC・営業時間内の電話サポート・ハードウェア RMA 調整を含み、P1 対応は 8 時間です。Premium はこれに 24/7 のカスタマーサポートポータルと 2 時間の P1 対応を追加します。Enterprise はさらに 30 分の P1 対応とカスタマーサクセスマネージャーを追加します。24/7 ポータルは Premium および Enterprise で利用可能です。