AI Fabric とは何か。
AI ファブリックとは、分散トレーニングおよび推論の際に GPU 間で RDMA トラフィックを伝送する GPU back-end(scale-out)ネットワークです。 It connects every GPU NIC across servers and pods using leaf and spine switches in rail-optimized and Clos topologies, and it runs a lossless Ethernet transport (RoCEv2 with PFC and ECN) so no packet is dropped under load. Because GPUs exchange data in lockstep collectives, the fabric's tail latency sets job completion time. This is the networking sense, not the enterprise "data fabric" used in data management. OcNOS-DC provides this fabric on Broadcom Tomahawk 5 hardware.
「data fabric」ではなく、ネットワーキングの意味
2 つの異なる分野が「fabric」という言葉を使います。data fabric とは、エンタープライズ全体でデータを統合しガバナンスするためのソフトウェアアーキテクチャです。本ページの主題である AI fabric は、物理ネットワーク、すなわち GPU 間で RDMA トラフィックを移動させる配線・スイッチ・トランスポートです。AI インフラチームが「fabric がボトルネックだった」と言うとき、彼らが意味するのはこのネットワーク、つまりトレーニング実行にどれだけ時間がかかるかを決定づけたものです。
- Data fabric。 システム全体でデータを統合しガバナンスするためのエンタープライズデータ管理アーキテクチャ。配線ではなくソフトウェアです。
- AI fabric. トレーニングおよび推論の際に GPU 間で RDMA を伝送する物理的な GPU back-end ネットワーク。本ページはこの意味についてのものです。
- なぜ重要か。 AI ファブリックはジョブ完了時間を決定づけるものであるため、ロスレスで均等に負荷がかかった状態を維持するよう設計されています。
rail・Clos、そしてドロップし得ないトランスポート
AI ファブリックは、1 つのトラフィックパターン、すなわち多数の GPU が大きなフローを同時に相互送信するパターンに最適化された leaf-spine(Clos)ネットワークです。3 つの設計上の選択がこれを定義しており、それぞれがジョブ完了時間を守るために存在します。
rail-optimized、その後 3 段 Clos
Each of a GPU server's 8 NICs connects to its own 専用 rail leafに接続され、支配的な同一 rail の AllReduce トラフィックが 1 つの leaf 上に留まるようにします。単一の pod を超えると、設計は leaf・spine・super-spine から成る 3 段 Clos へと拡張されます。
ロスレスRoCEv2
GPU は RDMA でデータを移動させますが、これはパケットがドロップされると性能が低下します。 PFC はスイッチキューのオーバーフローを防ぎ、 ECN はパケットに早期にマークを付け、送信側 NIC が損失発生前に速度を落とすようにします。この組み合わせが RoCEv2 を Ethernet 上で伝送します。
なぜロスレスでなければならないか
OcNOS-DC はこのファブリックを次とともに提供します。 PFC(over L3 を含む)、ECN、Dynamic ECN、WRED、そしてすべてのパスに均等に負荷をかけ続けるための動的ロードバランシング。テールフローがジョブ全体の完了時期を決定づけるためです。
Ethernet で十分であり、スイッチが上限を決める
AI ファブリックは今日、Ethernet ネットワークです。到達可能な範囲は、その下にあるスイッチシリコンと、設計対象とする GPU 数によって決まります。
- Ethernet で十分です。 PFC と ECN を備えた RoCEv2 は、標準的なマルチベンダーハードウェア上でロスレス RDMA を提供します。Meta は Ethernet 上に構築された 24,000-GPU のトレーニングクラスターを公表しています。
- スイッチが上限を決めます。 OcNOS-DC は、Edgecore AIS800-64D や UfiSpace S9321-64E といった Broadcom Tomahawk 5(51.2 Tbps、64x800G)プラットフォーム上で動作します。これは 800G GPU ファブリックが必要とする密度です。
- GPU 数に基づく設計。 Rail-optimized single pod up to roughly 1,000 GPUs, then a 3-stage Clos to 16,000+ and up to about 65,536 at the fat-tree limit.
AI Fabric とは何か FAQ
AIファブリックとは?
AI fabric は data fabric と同じか。
なぜ AI ファブリックがジョブ完了時間を決定づけるのか。
AI ファブリックには InfiniBand が必要か、それとも Ethernet で十分か。
AI ファブリックを構築しますか。一緒にサイジングしましょう。
GPU 規模とワークロードをお知らせいただければ、IP Infusion のエンジニアが、OcNOS-DC を実行するオープンな Tomahawk 5 ハードウェア上で、トポロジとポートの計算を一緒に行います。
OcNOS で AI ファブリック全体を設計
ビジネスケースからポート数の計算まで、構築のどの段階からでも着手できます。
さらに詳しく。資料をお持ち帰りください。
本ページよりさらに踏み込んだ、短く技術的な 2 つのダウンロード。OcNOS-DC の完全なデータシートと、ロスレス 800G AI ファブリックアーキテクチャです。
OcNOS-DC データシート
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
OcNOS 800G ロスレス AI Fabric
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。