ネットワーキングの定義 · RDMA · RoCEv2

AI Fabric とは何か。

AI ファブリックとは、分散トレーニングおよび推論の際に GPU 間で RDMA トラフィックを伝送する GPU back-end(scale-out)ネットワークです。 It connects every GPU NIC across servers and pods using leaf and spine switches in rail-optimized and Clos topologies, and it runs a lossless Ethernet transport (RoCEv2 with PFC and ECN) so no packet is dropped under load. Because GPUs exchange data in lockstep collectives, the fabric's tail latency sets job completion time. This is the networking sense, not the enterprise "data fabric" used in data management. OcNOS-DC provides this fabric on Broadcom Tomahawk 5 hardware.

RoCEv2ロスレス Ethernet トランスポート
51.2 TbpsTomahawk 5、64x800G
16,000+GPU、3 段 Clos
OcNOS-DCオープンハードウェア上の 1 つの NOS
1 つの言葉、2 つの意味

「data fabric」ではなく、ネットワーキングの意味

2 つの異なる分野が「fabric」という言葉を使います。data fabric とは、エンタープライズ全体でデータを統合しガバナンスするためのソフトウェアアーキテクチャです。本ページの主題である AI fabric は、物理ネットワーク、すなわち GPU 間で RDMA トラフィックを移動させる配線・スイッチ・トランスポートです。AI インフラチームが「fabric がボトルネックだった」と言うとき、彼らが意味するのはこのネットワーク、つまりトレーニング実行にどれだけ時間がかかるかを決定づけたものです。

  • Data fabric。 システム全体でデータを統合しガバナンスするためのエンタープライズデータ管理アーキテクチャ。配線ではなくソフトウェアです。
  • AI fabric. トレーニングおよび推論の際に GPU 間で RDMA を伝送する物理的な GPU back-end ネットワーク。本ページはこの意味についてのものです。
  • なぜ重要か。 AI ファブリックはジョブ完了時間を決定づけるものであるため、ロスレスで均等に負荷がかかった状態を維持するよう設計されています。
ファブリックはどのように構築されるか

rail・Clos、そしてドロップし得ないトランスポート

AI ファブリックは、1 つのトラフィックパターン、すなわち多数の GPU が大きなフローを同時に相互送信するパターンに最適化された leaf-spine(Clos)ネットワークです。3 つの設計上の選択がこれを定義しており、それぞれがジョブ完了時間を守るために存在します。

トポロジー

rail-optimized、その後 3 段 Clos

Each of a GPU server's 8 NICs connects to its own 専用 rail leafに接続され、支配的な同一 rail の AllReduce トラフィックが 1 つの leaf 上に留まるようにします。単一の pod を超えると、設計は leaf・spine・super-spine から成る 3 段 Clos へと拡張されます。

Transport

ロスレスRoCEv2

GPU は RDMA でデータを移動させますが、これはパケットがドロップされると性能が低下します。 PFC はスイッチキューのオーバーフローを防ぎ、 ECN はパケットに早期にマークを付け、送信側 NIC が損失発生前に速度を落とすようにします。この組み合わせが RoCEv2 を Ethernet 上で伝送します。

Behaviour

なぜロスレスでなければならないか

OcNOS-DC はこのファブリックを次とともに提供します。 PFC(over L3 を含む)、ECN、Dynamic ECN、WRED、そしてすべてのパスに均等に負荷をかけ続けるための動的ロードバランシング。テールフローがジョブ全体の完了時期を決定づけるためです。

これがどこに位置づけられるか

Ethernet で十分であり、スイッチが上限を決める

AI ファブリックは今日、Ethernet ネットワークです。到達可能な範囲は、その下にあるスイッチシリコンと、設計対象とする GPU 数によって決まります。

  • Ethernet で十分です。 PFC と ECN を備えた RoCEv2 は、標準的なマルチベンダーハードウェア上でロスレス RDMA を提供します。Meta は Ethernet 上に構築された 24,000-GPU のトレーニングクラスターを公表しています。
  • スイッチが上限を決めます。 OcNOS-DC は、Edgecore AIS800-64D や UfiSpace S9321-64E といった Broadcom Tomahawk 5(51.2 Tbps、64x800G)プラットフォーム上で動作します。これは 800G GPU ファブリックが必要とする密度です。
  • GPU 数に基づく設計。 Rail-optimized single pod up to roughly 1,000 GPUs, then a 3-stage Clos to 16,000+ and up to about 65,536 at the fat-tree limit.
よくある質問

AI Fabric とは何か FAQ

AIファブリックとは?
ネットワーキングにおいて、AI ファブリックとは、分散トレーニングおよび推論の際に GPU 間で RDMA トラフィックを伝送する GPU back-end(scale-out)ネットワークです。すべてのサーバーと pod をまたいで GPU NIC を接続し、AllReduce のようなコレクティブ演算が最も遅いリンクが許す速さで完了するようにします。rail-optimized および Clos トポロジの leaf スイッチと spine スイッチから構築され、ロスレス Ethernet トランスポート(PFC と ECN を備えた RoCEv2)を実行します。OcNOS-DC はそのファブリックを Broadcom Tomahawk 5 ハードウェア上で提供します。
AI fabric は data fabric と同じか。
いいえ。これらは 1 つの言葉を共有する異なる用語です。data fabric は、システム全体でデータを統合しガバナンスするためのエンタープライズデータ管理アーキテクチャです。ここで用いるネットワーキングの意味での AI fabric は、GPU 間で RDMA トラフィックを移動させる物理的な GPU back-end ネットワークです。本ページはネットワーキングの意味についてのものです。
なぜ AI ファブリックがジョブ完了時間を決定づけるのか。
GPU トレーニングはロックステップで実行されます。各ステップの後、GPU はコレクティブで勾配を交換し、すべての GPU は次のステップが始まる前にその交換の完了を待ちます。1 つのリンクが停止するかパケットをドロップすると、ジョブ全体が待たされます。ファブリックはそれらの交換のすべてを伝送するため、その平均ではなくテールレイテンシがトレーニング実行にかかる時間を決定づけます。これが、ファブリックがロスレスで均等に負荷がかかった状態を維持するよう設計されている理由です。
AI ファブリックには InfiniBand が必要か、それとも Ethernet で十分か。
Ethernet は今日、第一級の AI-ファブリックトランスポートです。PFC と ECN を備えた RoCEv2 は、標準的なマルチベンダーハードウェア上でロスレス RDMA を提供し、Meta は Ethernet 上に構築された 24,000-GPU のトレーニングクラスターを公表しています。OcNOS-DC は今日その RoCEv2 ファブリックを実行し、次世代のエンドポイントに向けて Ultra Ethernet Consortium 1.0 ファブリックプロファイルに準拠します。

AI ファブリックを構築しますか。一緒にサイジングしましょう。

GPU 規模とワークロードをお知らせいただければ、IP Infusion のエンジニアが、OcNOS-DC を実行するオープンな Tomahawk 5 ハードウェア上で、トポロジとポートの計算を一緒に行います。