ネットワーキングの定義 · Scale-out · RoCEv2

GPU Fabric とは何か。

GPU ファブリックとは、サーバーと pod をまたいで GPU を相互接続し、1 つのトレーニングまたは推論ジョブで協働できるようにする back-end ネットワークです。 GPU がコレクティブ演算の際に交換する RDMA トラフィックを、管理とストレージに用いられるフロントエンドネットワークとは分離して伝送します。これは、NVLink のようなサーバー内 scale-up ドメインが終わる地点から始まる scale-out ネットワークであり、ロスレス RoCEv2 を実行する rail-optimized および Clos トポロジから構築されます。OcNOS-DC はこれを Broadcom Tomahawk 5 ハードウェア上で提供します。

~2,048 GPUs2 階層、1:1 ノンブロッキング
16,000 以上の GPU3 段 Clos 規模
51.2 TbpsTomahawk 5 · 64x800G
1 NOSオープンハードウェア上の OcNOS-DC
ファブリックが始まる地点

scale-up が終わり、scale-out が始まる

GPU ファブリックは明確な境界の一方の側に位置します。サーバー内部では scale-up ドメインがテラビット速度で動作し、サーバー間では scale-out GPU ファブリックが残りを伝送します。コレクティブはまずドメイン内で scale-up を使用し、その後このファブリックがサーバー間トラフィックを伝送します。

サーバー内部

scale-up ドメイン

GPU サーバーとその密結合ドメイン内部の、非常に高帯域なインターコネクト。例えば NVL72 ラック内の NVLink. GPUs here talk as if they were one large accelerator. This is not the GPU fabric.

サーバー間

スケールアウト GPU ファブリック

サーバーおよびポッド間をまたぐ Ethernet ネットワーク(対象範囲 rail・leaf・spine・Clos の各階層. This is the GPU fabric. Because same-rail traffic is often absorbed by scale-up first, this plane carries the cross-rail and cross-pod remainder, which is why 1:1 non-blocking is worth paying for here specifically.

ファブリックの構成方式

Rail と Clos

ほとんどの GPU ファブリックは rail 最適化された leaf-spine ネットワークです。GPU サーバーの 8 基の NIC はそれぞれ専用の rail leaf に接続され、支配的な同一 rail の AllReduce トラフィックは 1 台の leaf 上にとどまり、spine を越えることはありません。単一ポッドを超えると、設計は super-spine 階層を備えた 3 段 Clos へと拡張されます。

Rail 最適化された leaf

サーバーの各 8 NICs はそれぞれ専用の rail leaf に対応付けられ、支配的な同一 rail の AllReduce トラフィックを 1 台の leaf 上にとどめ、spine から切り離します。

3 段 Clos 規模

radix-64 の Tomahawk 5 では、2 階層ファブリックが約 2,048 GPUs を 1:1 ノンブロッキングで実現し、3 段 Clos は次まで拡張します: 16,000 以上の GPU.

ロスレス RoCEv2 トランスポート

GPU プレーンは次を介して RDMA を伝送します: RoCEv2。ロスレスに設計されており、コレクティブがパケットドロップで停止することはありません。

GPU プレーンにおいて

ロスレス RoCEv2。OcNOS-DC がこれを提供します

GPU は RoCEv2 上の RDMA でデータを移動しますが、これはパケットロス下では性能が低下します。そのため GPU ファブリックはロスレスに設計され、負荷が均等に保たれることで、コレクティブの実行中にどのリンクもホットスポットになりません。OcNOS-DC は Broadcom Tomahawk 5 上でまさにこれを、オープンなマルチベンダーハードウェアのイネーブラーとして提供します。

  • Priority Flow Control(L3 上を含む)と ECN によりロスレスに設計されており、トレーニングステップがパケットドロップで停止することはありません。
  • Dynamic ECN と DLB により負荷が均等に保たれ、コレクティブの実行中にどの単一リンクもホットスポットになりません。
  • Edgecore AIS800-64D や UfiSpace S9321-64E などの Broadcom Tomahawk 5(51.2 Tbps、64x800G)プラットフォーム上で OcNOS-DC により提供されます。
よくある質問

GPU ファブリックとは何か FAQ

GPUファブリックとは?
GPU ファブリックとは、サーバーおよびポッドをまたいで GPU を相互接続し、単一のトレーニングまたは推論ジョブで協調動作させる back-end ネットワークです。コレクティブ操作中に GPU が交換する RDMA トラフィックを伝送し、管理およびストレージに用いる front-end ネットワークとは分離されています。実際には GPU ファブリックは、通常 rail 最適化され、ロスレス RoCEv2 を動作させる leaf-spine(Clos)Ethernet ネットワークです。OcNOS-DC は Broadcom Tomahawk 5 ハードウェア上でこれを提供します。
scale-up と scale-out の違いは何ですか。
scale-up は、GPU サーバーおよびその密結合ドメイン内部の超広帯域インターコネクトであり、たとえば NVL72 ラック内の NVLink がこれにあたります。ここでは GPU が 1 つの大きなアクセラレータであるかのようにテラビット速度で通信します。scale-out はサーバーおよびポッド間のネットワークであり、本ページで説明する GPU ファブリックがこれにあたります。Ethernet 上に rail・leaf・spine・Clos の各階層で構築されます。コレクティブはまずドメイン内で scale-up を用い、続いてサーバー間の残りを scale-out GPU ファブリックが伝送します。
GPU ファブリックはどのトポロジを用いますか。
Most GPU fabrics use a rail-optimized leaf-spine design: each of a GPU server's 8 NICs connects to its own dedicated rail leaf, so the dominant same-rail AllReduce traffic stays on one leaf. As the cluster grows past a single pod, the design extends to a 3-stage Clos with a super-spine tier. radix-64 の Tomahawk 5 では、2 階層ファブリックが約 2,048 GPUs at 1:1 non-blocking and a 3-stage Clos scales to 16,000+ GPUs. See the rail-optimized network and AI fabric topologies pages.
GPU ファブリックはロスレスでなければなりませんか。
はい、GPU プレーンにおいてはそうです。GPU は RoCEv2 上の RDMA でデータを移動しますが、これはパケットロス下では性能が低下するため、GPU ファブリックは Priority Flow Control と ECN によりロスレスに設計され、動的ロードバランシングにより負荷が均等に保たれます。このノードロップ動作こそがコレクティブの停止を防ぎます。OcNOS-DC は、まさにこのために Broadcom Tomahawk 5 上で PFC・ECN・Dynamic ECN・DLB を提供します。

GPU ファブリックの構築をご検討ですか。プレーンのサイジングをご一緒に。

GPU 数とワークロードをお知らせいただければ、IP Infusion のエンジニアがポート計算をご一緒に行います。あるいは AI Fabric Design Suite で rail 最適化レイアウトの初案から着手いただけます。