OcNOS AI Fabric:GPU クラスター向けのオープンな 800G ロスレスイーサネット
OcNOS AI Fabric は、キャリアグレードのネットワーキングを GPU クラスターにもたらす、完全なロスレスイーサネットシステムです。IP Infusion はこれを OcNOS Systems として一括で提供します。Edgecore または UfiSpace の検証済み 800G オープンスイッチで OcNOS-DC を稼働させ、1 つのサポート契約のもと、NIC、GPU、スイッチの選択肢をオープンに保ちます。PFC、ECN ベースの輻輳制御(DCQCN)、ミリ秒未満の DLB によるロスレス RoCEv2 RDMA を、現在すでに本番環境で運用しています。IP Infusion は Ultra Ethernet Consortium のメンバーです。
アーキテクチャブリーフをダウンロード
このページより踏み込んだ 4 つの短い資料:ロスレス AI ファブリックのアーキテクチャ、OcNOS-DC の完全なデータシート、EVPN-VXLAN データセンターのリファレンス、IPoDWDM による次世代 DCI。
OcNOS 800G イーサネットベースのロスレス AI ファブリック
Tomahawk 4/5スパイン上のノンブロッキングRoCEv2ファブリック:SKUティア、検証済みプラットフォーム、導入アーキテクチャ。
概要資料を入手EVPN-VXLAN データセンターファブリック
オープンなleaf-spineデータセンターファブリック:EVPN Type-2およびType-5ルート、分散型エニーキャストゲートウェイ、マルチテナントVNIs。
概要資料を入手IPoDWDM による次世代 DCI
トランスポンダ層を集約し、コヒーレントな 400G/800G ZR および ZR+ 光モジュールをルーターから直接運用してデータセンター間接続を実現します。
概要資料を入手OcNOS-DC データシート
OcNOS-DC の完全な仕様。EVPN-VXLAN と Ethernet for AI の機能セット、ソフトウェア SKU、サポート対象ハードウェアプラットフォーム、ソリューション発注ガイドを収録しています。
データシートを入手ジョブ完了時間を左右する要素
スケール時に重要なのは、スイッチのスループットではなく、ジョブがどれだけ速く完了しGPUがどれだけ稼働し続けるか。クラスターが同期のために停止するたびに、アイドル状態のGPUが処理能力を浪費するため、ファブリックは一切パケットを落とさず、輻輳が始まった瞬間に対応する必要がある。
OcNOS-DC はすべての設定を公開しているため、ベンダーの固定プロファイルを受け入れるのではなく、実際の GPU 集合通信トラフィック(xCCL:NCCL、RCCL、oneCCL)に合わせて各チームがファブリックをチューニングできます。以下の各パターンは、クラスターが停滞する要因の 1 つと、OcNOS-DC がそれを解消する方法を示しています。
→ DLB 1 ミリ秒未満でフローを負荷の低いパスへと切り替えます。
→ GLB は、ローカルホップだけでなくファブリック全体で負荷分散を行うために OcNOS のロードマップに含まれています。
→ DCQCN 何かがあふれる前に、早い段階で送信元を減速させます。
→ PFC ウォッチドッグ スタックしたポートを自動的に復旧します。
→ DLB は、現在運用している RoCEv2 ファブリック上で、混雑したパスからフローレットを移動させます。
→ Ultra Ethernet(UEC) は、UEC 対応 NIC から 1 つのフローを多数のパスに分散するマルチパストランスポートです。
容量の行き先。 静的 ECMP は大きなフローをそれぞれ 1 つのパスに固定するため、エレファントフローが一部のアップリンクに集中し、他のアップリンクは遊休状態になります。動的ロードバランシングはリアルタイムの輻輳に応じてフローを再割り当てしてすべてのアップリンクを活用するため、適切に運用された AI ファブリックは、アップリンクを追加せずに同じスイッチで 90% 台の使用率を目標にできます。OcNOS-DC は Tomahawk 4 と 5 で DLB を提供します。
DLB 詳細解説 →800G スパイン・リーフ、 エンドツーエンドでロスレス
各チームが熟知するleaf-spine(Clos)設計を、GPUトラフィックを損失なく処理できるよう構築。ルーテッドeBGPアンダーレイがすべての経路にトラフィックを均等分散し、ロスレスな優先度キューがRoCEv2フローを保護、独立した管理ネットワークがスイッチを起動し、テレメトリを単独でストリーミング。チェックポイントおよびデータセット向けのleaf接続NVMe-oFならびにNFSストレージは、GPUラックに隣接して配置。詳細は以下を参照 DC ファブリック でストレージファブリックの詳細をご確認ください。各ノードにカーソルを合わせると、プラットフォーム、ポート数、チップが表示されます。

ノードにカーソルを合わせると機能とプラットフォームの詳細を表示・・全HCL:40以上の検証済みプラットフォームはこちら ipinfusion.com/hcl
各 GPU NIC を専用レールに配置し、ポッド単位でスケール
レール最適化ファブリックでは、各 GPU サーバーが 8 台の専用レールリーフのそれぞれに NIC を 1 つずつ接続するため、大半を占める同一レールの AllReduce は 1 台のリーフ内にとどまり、レールをまたぐトラフィックだけがスパインに到達します。同じ 800G Tomahawk 5 スイッチでポッド単位にスケールします。詳しくは レール最適化の詳細解説 と、すべての リファレンストポロジー.

検証済みのオープンスイッチ
OcNOS-DC は Edgecore および UfiSpace の Broadcom Tomahawk/Trident スイッチ上で動作するため、あらゆるプラットフォームが検証済みで、発注可能かつセカンドソース調達可能です。

Edgecore AIS800-64D
64 x 800G · 51.2 Tbps
QSFP-DD800 · 2x400G/4x200G/8x100Gへのブレイクアウト

UfiSpace S9321-64E
64 x 800G · 51.2 Tbps
QSFP-DD800 · 2x400G/4x200G/8x100Gへのブレイクアウト

Edgecore AS9736-64D
64 x 400G · 25.6 Tbps
QSFP56-DD 400G · 4x100G/4x25Gへのブレイクアウト · DAC/AOC
HCL で 40 種類以上の検証済みプラットフォームをすべて見る →
Broadcom Tomahawk と Trident の各ファミリーの違い、そして OcNOS が動作するすべてのオープンスイッチ →
OcNOS Systems:ソフトウェア・ハードウェア・サポートを単一ベンダーが担保
単一の契約、単一の問い合わせ先チーム
OcNOS Systems として購入した場合、ファブリックは IP Infusion との単一の契約で OcNOS-DC ソフトウェアと検証済みのスイッチハードウェアを一括してカバーするため、NOS ベンダーとハードウェアベンダーが分かれることなく、TAC も SLA も一本化されます。Premium および Enterprise ティアでは 24/7 のサポートポータルを利用可能です。
サポート詳細を見るファブリックを一元管理する単一コンソール
IP Maestro は OcNOS 向けのエレメント管理システムです: NETCONF を介して全スイッチのトポロジー、障害、コンフィグレーション、ソフトウェアイメージを扱い、既存の OSS の下位に位置します。大規模なマルチサイトのフリートを一つのコンソールから管理します。
IP Maestro を見るストリーミングテレメトリとゼロタッチ
gNMI ストリーミングテレメトリが Prometheus と Grafana にデータを供給し、DCBX が各サーバーへ正しいロスレス設定を自動的にプッシュし、ゼロタッチプロビジョニングが起動時に構成済みの状態でスイッチを立ち上げます。
自動化を試すNVIDIA Spectrum-X に対する、オープンでマルチベンダーの代替
OcNOS-DC は、複数のオープンハードウェアベンダーによる標準 Ethernet スイッチ上でロスレス RoCEv2 の AI ファブリックを稼働させ、OcNOS Systems として購入した場合は一つのサポート契約で対応します。AI トレーニングジョブが依存するファブリックメカニズムに対応しつつ、NIC、GPU、ハードウェアの選択を単一ベンダーに固定せずオープンに保ちます。
| 商談を左右する要素 | オープンAIファブリック(Edgecore/UfiSpace上のOcNOS-DC) | クローズドな NIC とスイッチの一体型スタック |
|---|---|---|
| ハードウェア調達 | 複数ベンダーによるオープンなマーチャントシリコン(Edgecore、UfiSpace) | シングルベンダーのスイッチ、NIC、GPU |
| NIC および GPU の選択 | オープン。NICとGPUを個別に交換可能 | NIC と GPU のロードマップが単一ベンダーに依存 |
| ロスレス RoCEv2 (PFC、ECN、DCQCN) | ✓ 詳細 → | ✓ |
| アダプティブロードバランシング | ✓ ミリ秒未満の DLB フローレット再割り当て 詳細 → | ✓ (独自仕様) |
| PFCデッドロック保護 | ✓ 自動ドレイン付きデッドロックウォッチドッグ 詳細 → | ✓ |
| ストリーミングテレメトリと自動化 | ✓ gNMI, OpenConfig, ZTP, DCBX, Ansible | ✓ (ベンダーのパイプライン) |
| 単一のサポート契約(スイッチとソフトウェア) | ✓ OcNOS Systems なら 1 つの TAC、1 つの SLA | ✓ (単一ベンダー) |
| GPUシリコンバックエンド統合 | 標準の Ethernet。GPU シリコンとのコデザインなし | NIC、スイッチ、GPU を単一ベンダーが協調設計 |
| ファブリックコントローラー層 | gNMI テレメトリと、既存の OSS または IP Maestro を通じて管理 | ベンダー統合型のファブリックコントローラー層 |
NVIDIA および Spectrum-X は NVIDIA Corporation の商標です。IP Infusion は NVIDIA と提携しておらず、NVIDIA を推奨するものでもありません。この比較は、次で確認できる OcNOS-DC の機能に基づいています: フィーチャーマトリクス.
OcNOS-DCの位置づけ
OcNOS-DC は、2026 年の AI ファブリックの選択肢の多くが共有する技術的水準を満たしています:ロスレス RoCEv2、輻輳制御、アダプティブルーティング。したがって判断は、次に集約されます 取引の形態:オープンなオペレーティングシステムかロックされたスタックか、オープンなハードウェアかロックされたハードウェアか、標準の Ethernet か閉じた InfiniBand か。 Here is where each one leaves you.
各選択肢はそれぞれ異なる優先事項に対応します。OcNOS-DC は、オープンなハードウェア・完全なソリューション・ロックインの排除を強みとします。
GPU ファブリックを数分でサイジング
GPU 数と NIC 速度を入力してください。AI Fabric Design Suite が、leaf-spine トポロジー・スイッチおよびポート数・そのまま見積もりに使える部品表 (BOM) へと対応付けます。スプレッドシートは不要です。
OcNOS をデータセンター全体へ拡張
AI はデータセンターの一領域に過ぎません。同一の OcNOS イメージがコンピュート・ストレージ・リモートサイトへと広がり、同じ NOS・同じ CLI・同じサポートを提供します。
よくあるご質問
AI Fabricリファレンスデザイン
簡単なフォームです。送信後すぐに PDF が開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
OcNOS 800G イーサネットベースのロスレス AI ファブリック
簡単なフォームです。送信後すぐに PDF がダウンロードされます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
EVPN-VXLAN データセンターファブリック
簡単なフォームです。送信後すぐに PDF がダウンロードされます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
IPoDWDM による次世代 DCI
簡単なフォームです。送信後すぐに PDF がダウンロードされます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
OcNOS-DC データシート
簡単なフォームです。送信後すぐに PDF がダウンロードされます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
AIファブリックおよびDC導入
Broadcom Tomahawk 4/5上でOcNOS-DCを運用する、本番AIクラスターおよびデータセンターファブリック。

NTT DATA は IP Infusion と提携してオープンネットワーキングソリューションを市場に展開し、OcNOS 搭載の Cell Site Router、Routed Optical…

Scott Dataは、UfiSpace、Edgecore Networks、CelesticaのオープンネットワーキングハードウェアでOcNOSを導入し、全社にわたるレガシーベンダースタックを置き換え…

フランス拠点のデータセンターシステムインテグレーターであるMadeo Consultantは、Cisco NexusおよびCatalystスイッチをEdgecore上のIP Infusion OcNOSに置き換え…

フランスのISPおよびマネージドサービスプロバイダーであるProsoluceは、IP Infusion OcNOSを稼働する100G EVPN-VXLANバックボーンへとコアをアップグレードしました…
ブログの関連記事
AIネットワーク意思決定フレームワーク:速度、ROI、戦略的自由度のためのGPUファブリック
RoCEv2とオープンハードウェアを用いたGPUファブリック選定のためのバイヤー視点のフレームワーク
記事を読む →データセンター向けOcNOS 7.0:AIファブリック、800Gプラットフォーム、大規模EVPN-VXLAN
OcNOS 7.0で提供される800G AIファブリック機能とTomahawk 5プラットフォーム
記事を読む →OcNOS 7.0:AI、トランスポート、クラウド向けの新機能
GPUクラスター向けにPFCを用いたRoCEv2ロスレストランスポートを強調
記事を読む →データセンター向けOcNOS 6.6:AIファブリックPFC/ETS、EVPNポリシー、400G
OcNOS AIファブリック導入を支えるPFC/ETSロスレスDCB機能
記事を読む →OcNOS で AI ファブリック全体を設計
ビジネスケースからポート数の計算まで、構築のどの段階からでも着手できます。
こちらからご連絡いたしましょうか?
ご連絡先をご記入ください。IP Infusionのチームが、AIファブリックの設計をお手伝いいたします。ご希望の場合のみご連絡いたします。