ダイナミックロードバランシング:AI Fabric向けアダプティブルーティング
静的ハッシュ方式のECMPは、GPUコレクティブではなくノースサウスのWebトラフィック向けに設計されたものです。OcNOS Dynamic Load Balancing(DLB)は、サブミリ秒間隔でフローレットを輻輳の少ない経路へ再割り当てし、分散トレーニングワークロードにおけるEthernetとInfiniBandの差を縮めます。
リーフスパインファブリックにおける Adaptive Routing
GPU AllReduce トラフィックを伝送する4 スパイン、2 リーフのスライス。DLB はローカルのイグレスキュー深度をリアルタイムで測定します。Spine-3 が飽和すると、リーフは次のフローレットを Spine-2 へ再バインドし、4 本のアップリンクすべてのバランスを保ちます。
静的ECMPがAIファブリックで破綻する理由
標準的なECMPは、フロー開始時に5-tupleをハッシュして出力ポートを選択し、そのフローを生存期間全体にわたって同一ポートに固定します。ノースサウスのWebトラフィックでは、数百万の短命なフローが大数の法則により経路間の使用率を平準化します。AIファブリックでは、ごく少数の エレファントフロー はGPUの集合通信(AllReduce、AllGather、All-to-All)に起因し、それぞれが400Gまたは800Gのアップリンク全体を数秒間にわたり占有します。同じアップリンクにハッシュされた2つのエレファントフローは、その処理の間ずっと衝突し続け、その一方で別のアップリンクはアイドル状態のままとなります。
The result is hash polarisation: measured fabric utilisation around 50-60% with random hot-spots, and tail-latency outliers that stall the entire training job. DLB closes this gap by re-evaluating the path decision on every flowlet, a sub-flow chunk delimited by a small inter-packet gap, using live egress queue-depth and port-utilisation telemetry from the ASIC. To size a leaf-spine fabric for your GPU cluster, use the AI Fabric サイジングツール.
OcNOS の DLB 実装
サブミリ秒ギャップタイマー
ASIC-native flowlet inactivity timer (typical 16-256 µs) splits long elephant flows into chunks safe to spray across paths without TCP/RoCEv2 reordering.
キュー深度のリアルタイムフィードバック
DLBはTomahawkパイプラインから出力ポート単位のキュー占有率とリンク使用率のシグナルを取得し、すべてのECMPネクストホップをリアルタイムでスコアリング。
適応型ネクストホップ選択
フローレット境界において、最も品質の高いメンバーが選択されます。メンバー品質は数マイクロ秒ごとに再計算されるため、飽和したスパインは1フローレット以内に候補セットから除外されます。
PFC・ECNとの協調チューニング
DLBはRoCEv2ロスレススタック(PFC、ECN/DCQCN、ヘッドルーム計算)と統合され、ポーズフレームが上流へ伝播する前にフローレットの再バインドが実行されます。
gNMIエクスポート
メンバー単位のリバインド回数、フローレットギャップ分布、メンバー品質スコアをgNMIダイヤルアウトでストリーミングし、クローズドループのファブリックチューニングを実現。
TH4 / TH5 ネイティブ
Broadcom Tomahawk 4(25.6T)およびTomahawk 5(51.2T)スパインプラットフォーム上で、64×400Gおよび64×800Gのポート構成にて検証済み。ソフトウェアファストパスへの性能ペナルティはありません。
本番 AI ファブリックにおける DLB の提供価値
- より高い使用率。 業界公表のflowlet再配分ベンチマークでは、同一ハードウェア上で、追加のアップリンクを購入することなく、静的ECMPでの約55%から90%超へとファブリック利用率が向上します。
- より低いテール遅延。 他のリンクがアイドル状態のまま単一リンクが飽和することがないため、P99.9のコレクティブ完了時間が引き締まります。
- 学習を高速化。 最も遅いランクを待つGPUのアイドル時間が減ることは、AllReduce負荷の高いワークロードにおける測定可能なウォールクロック改善を意味します。
- NICの変更不要。 DLB はスイッチ ASIC 上で動作。既存の RoCEv2 NIC と xCCL (NCCL / RCCL / oneCCL) コレクティブスタックは、コード変更なしに正しい順序での配送を受けます。
- ライセンスは1つ。 DLBはOcNOS-DC PLUS SKUに含まれる機能。同一イメージ、同一サポート契約、機能ごとの追加課金なし。
GPUファブリック向けにDLBをチューニングしますか?
技術デモをリクエスト →よくあるご質問
flowlet とは何であり、DLB はなぜそれを使用するのですか。
DLB は静的な ECMP とどのように異なりますか。
DLBには、新しいNICや集合演算ライブラリの変更が必要ですか。
どのハードウェアが OcNOS DLB をサポートしていますか。
さらに詳しく。資料をお持ち帰りください。
本ページより踏み込んだ、簡潔で技術的な 2 つのダウンロード資料です。lossless な 800G AI fabric アーキテクチャと、EVPN-VXLAN の data center リファレンスをご用意しています。
OcNOS 800G ロスレス AI Fabric
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
Solution_Brief-OcNOS_800G_Ethernet-Based_Lossless_AI_Fabric.pdfEVPN-VXLAN データセンターファブリック
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
OcNOS-modernize-your-data-center-EVPN-VxLAN_Solution-Brief.pdfDesign the whole AI fabric with OcNOS
From the business case to the port-count maths, pick up wherever you are in the build.