GPU Fabric とは何か。
GPU ファブリックとは、サーバーと pod をまたいで GPU を相互接続し、1 つのトレーニングまたは推論ジョブで協働できるようにする back-end ネットワークです。 GPU がコレクティブ演算の際に交換する RDMA トラフィックを、管理とストレージに用いられるフロントエンドネットワークとは分離して伝送します。これは、NVLink のようなサーバー内 scale-up ドメインが終わる地点から始まる scale-out ネットワークであり、ロスレス RoCEv2 を実行する rail-optimized および Clos トポロジから構築されます。OcNOS-DC はこれを Broadcom Tomahawk 5 ハードウェア上で提供します。
scale-up が終わり、scale-out が始まる
GPU ファブリックは明確な境界の一方の側に位置します。サーバー内部では scale-up ドメインがテラビット速度で動作し、サーバー間では scale-out GPU ファブリックが残りを伝送します。コレクティブはまずドメイン内で scale-up を使用し、その後このファブリックがサーバー間トラフィックを伝送します。
scale-up ドメイン
GPU サーバーとその密結合ドメイン内部の、非常に高帯域なインターコネクト。例えば NVL72 ラック内の NVLink. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.
スケールアウト GPU ファブリック
サーバーおよびポッド間をまたぐ Ethernet ネットワーク(対象範囲 rail・leaf・spine・Clos の各階層. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.
Rail と Clos
ほとんどの GPU ファブリックは rail 最適化された leaf-spine ネットワークです。GPU サーバーの 8 基の NIC はそれぞれ専用の rail leaf に接続され、支配的な同一 rail の AllReduce トラフィックは 1 台の leaf 上にとどまり、spine を越えることはありません。単一ポッドを超えると、設計は super-spine 階層を備えた 3 段 Clos へと拡張されます。
Rail 最適化された leaf
サーバーの各 8 NICs はそれぞれ専用の rail leaf に対応付けられ、支配的な同一 rail の AllReduce トラフィックを 1 台の leaf 上にとどめ、spine から切り離します。
3 段 Clos 規模
radix-64 の Tomahawk 5 では、2 階層ファブリックが約 2,048 GPUs を 1:1 ノンブロッキングで実現し、3 段 Clos は次まで拡張します: 16,000 以上の GPU.
ロスレス RoCEv2 トランスポート
GPU プレーンは次を介して RDMA を伝送します: RoCEv2。ロスレスに設計されており、コレクティブがパケットドロップで停止することはありません。
ロスレス RoCEv2。OcNOS-DC がこれを提供します
GPU は RoCEv2 上の RDMA でデータを移動しますが、これはパケットロス下では性能が低下します。そのため GPU ファブリックはロスレスに設計され、負荷が均等に保たれることで、コレクティブの実行中にどのリンクもホットスポットになりません。OcNOS-DC は Broadcom Tomahawk 5 上でまさにこれを、オープンなマルチベンダーハードウェアのイネーブラーとして提供します。
- Priority Flow Control(L3 上を含む)と ECN によりロスレスに設計されており、トレーニングステップがパケットドロップで停止することはありません。
- Dynamic ECN と DLB により負荷が均等に保たれ、コレクティブの実行中にどの単一リンクもホットスポットになりません。
- Edgecore AIS800-64D や UfiSpace S9321-64E などの Broadcom Tomahawk 5(51.2 Tbps、64x800G)プラットフォーム上で OcNOS-DC により提供されます。
GPU ファブリックとは何か FAQ
GPUファブリックとは?
scale-up と scale-out の違いは何ですか。
GPU ファブリックはどのトポロジを用いますか。
GPU ファブリックはロスレスでなければなりませんか。
さらに詳しく。資料をお持ち帰りください。
本ページよりさらに踏み込んだ、短く技術的な 2 つのダウンロード。OcNOS-DC の完全なデータシートと、ロスレス 800G AI ファブリックアーキテクチャです。
OcNOS-DC データシート
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
OcNOS 800G ロスレス AI Fabric
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
GPU ファブリックの構築をご検討ですか。プレーンのサイジングをご一緒に。
GPU 数とワークロードをお知らせいただければ、IP Infusion のエンジニアがポート計算をご一緒に行います。あるいは AI Fabric Design Suite で rail 最適化レイアウトの初案から着手いただけます。
OcNOS で AI ファブリック全体を設計
ビジネスケースからポート数の計算まで、構築のどの段階からでも着手できます。