RDMA とは何か。
RDMA(Remote Direct Memory Access)は、一方のマシンがネットワーク経由で他方のマシンのメモリを直接読み書きすることを可能にし、双方の CPU とオペレーティングシステムをバイパスします。 ネットワークアダプタが両端のアプリケーションメモリ間でバイトを直接移動させるため、レイテンシは極めて低く、CPU オーバーヘッドはほぼゼロです。Ethernet 上では RoCEv2 が RDMA を伝送してルーティング可能にし、RDMA はパケットがドロップされないことを前提とするため、ロスレスファブリック上で動作します。
ゼロコピー、CPU バイパス、そしてそれが要点である理由
通常のネットワーク転送はデータをカーネル経由でコピーし、両端で CPU に依存します。RDMA はその両方を取り除きます。アダプタは送信側のアプリケーションメモリから直接読み取り、受信側のアプリケーションメモリへ直接書き込み、データパス上で CPU を経由するものは何もありません。これこそが、RDMA の極めて低いレイテンシ・極めて高いスループット・ほぼゼロの CPU コストという組み合わせを実現し、RDMA が GPU 間通信の標準となった理由です。
- Zero-copy: バイトは両端のアプリケーションメモリ間を直接移動し、中間のカーネルバッファを介して段階的に受け渡されることはありません。
- カーネルバイパス: オペレーティングシステムではなくネットワークアダプタが転送を駆動するため、CPU はデータパスから外れます。
- ほぼゼロのオーバーヘッド: CPU はパケットの取り回しではなくワークロードの実行に振り向けられ、これは GPU 規模において決定的です。
RoCEv2 が Ethernet 上で RDMA を伝送する仕組み
RoCEv2(RDMA over Converged Ethernet, version 2)は、宛先 UDP port 4791 を用いて RDMA を UDP および IP にカプセル化し、別個のネットワークを必要とせずに標準の Layer 3 Ethernet ファブリック全体にわたってルーティング可能にします。RDMA 操作は依然として同じゼロコピー動作でアダプタ間で実行され、RoCEv2 はそれにルーティング可能な Ethernet 経路を与えるだけです。これこそが、マルチベンダー Ethernet ファブリックが GPU クラスターにおいて InfiniBand の代わりを務めることを可能にします。
ルーティング可能なトランスポート
RDMA は次の内部を伝送されます: port 4791 上の UDP および IP。そのため専用ファブリックを必要とせず、標準のルーティングされたデータセンターを横断します。
ノードロップネットワーク
RDMA はネットワークがパケットをドロップしないことを前提とするため、次の上で動作します: ロスレスファブリック 。PFC と ECN があらゆるホップをノードロップに保ちます。
AI ファブリック
このトランスポートは次の基盤です: AIファブリック: the GPU-to-GPU network that carries every collective during training.
AI コレクティブが RDMA に依存する理由と、ファブリックがロスレスでなければならない理由
AI トレーニングは AllReduce などのコレクティブ操作を実行します。各ステップの後、あらゆる GPU が他のすべての GPU と勾配を交換し、次のステップの前に全員がその交換を待ちます。データ量は大きくスケジュールは厳しいため、RDMA は各交換を高速かつ CPU から切り離して保ちます。単一のパケットロスでも回復処理が強制され、テールレイテンシが急増しコレクティブ全体を停止させかねないため、Ethernet 上の RDMA は常にロスレスファブリック上で動作します。
- コレクティブは交換が完了するまであらゆる GPU をブロックするため、 レイテンシの低減はステップを短縮します 。クラスター全体がそのステップを待っています。
- RDMA は交換を保ちます CPU から切り離し、コピーを排して。これは数百万ステップにわたって積み重なり、総トレーニング時間に対する直接的なレバーとなります。
- OcNOS-DC はノードロップファブリックを次で提供します: PFC、ECN、動的ロードバランシング 。Broadcom Tomahawk 5 上で、フローをホットリンクから遠ざけます。
RDMA とは何か、その回答
RDMAとは?
RoCEv2 は Ethernet 上でどのように RDMA を伝送しますか。
ゼロコピーと CPU バイパスは AI にとってなぜ重要ですか。
なぜ RDMA にはロスレスファブリックが必要ですか。
RDMA ファブリックの設計をご検討ですか。ロスレスに構築しましょう
ワークロードと GPU 規模をお知らせいただければ、IP Infusion のエンジニアが、OcNOS-DC を動作させるオープンハードウェア上で RoCEv2 およびロスレスファブリックの設計をご一緒に進めます。
OcNOS で AI ファブリック全体を設計
ビジネスケースからポート数の計算まで、構築のどの段階からでも着手できます。
さらに詳しく。資料をお持ち帰りください。
本ページよりさらに踏み込んだ、短く技術的な 2 つのダウンロード。OcNOS-DC の完全なデータシートと、ロスレス 800G AI ファブリックアーキテクチャです。
OcNOS-DC データシート
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
OcNOS 800G ロスレス AI Fabric
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。