Global Load Balancing:ファブリック全体のアダプティブルーティング
DLB は 1 ホップで正しい判断を下し、GLB はファブリック全体にわたって正しい判断を下します。 OcNOS 7.1 ロードマップにおいて、Global Load Balancing はアダプティブルーティングをポート単位の視点からエンドツーエンドのパス品質へと拡張し、16,384-GPU の上限に至る 3-stage Clos AI ファブリック上でのマルチホップホットスポットのギャップを埋めます。GLB は DLB を置き換えるのではなく、その上に重ねて構成されます。
ローカルホップだけでなくパス全体をスコアリング
GPU AllReduce を運ぶ 3-stage Clos スライス(leaf、spine、super-spine)。各階層はキュー占有率とリンク利用率のテレメトリを ingress leaf へと送り返します。GLB は最良のローカルイグレススコアではなく、最良のエンドツーエンドスコアを持つパスを選択するため、輻輳したダウンリンクに行き着くクリーンなアップリンクが盲目的に選ばれることはもはやありません。
DLB と GLB、パス判断の範囲による比較
DLB は各 ECMP ネクストホップをローカルイグレスのキュー深度を用いてスコアリングし、2-tier leaf-spine 上では最適です。3-tier Clos へと規模を拡大すると、クリーンなアップリンクを持つ spine を選んだつもりが、egress leaf へ戻るダウンリンクが輻輳している super-spine に行き着くことがあります。ローカルな視点は正しくても、エンドツーエンドの視点は誤っています。super-spine を備えた 3-stage Clos が標準となる 1,024-GPU 以上のファブリックでは、これがテールレイテンシの外れ値の残された主要因となります。
| 観点 | DLBローカル、本日出荷済み | GLBグローバル、OcNOS 7.1 ロードマップ |
|---|---|---|
| 判断の範囲 | ホップ単位:各スイッチが自身の ECMP ネクストホップをランク付け。 | エンドツーエンド:ingress leaf が leaf 間のパス全体をランク付け。 |
| 使用するシグナル | 当該スイッチ上のローカルイグレスのキュー深度とリンク利用率。 | 全階層から集約され ingress へと戻される輻輳テレメトリ。 |
| 最適な選択 | 2-stage ファブリック、および 3-stage における leaf から spine へのホップ。 | super-spine を備えた 3-stage Clos、16,384-GPU の上限まで。 |
| 捕捉されるホットスポット | ローカルイグレスの輻輳のみ。 | ローカルホップからは見えない下流のホットスポット。 |
| 再割り当て | フローレット整合、RoCEv2 および TCP で順序どおり。 | フローレット整合、同一の順序保証、ファブリック全体の入力。 |
| ハードウェア | 本日 TH4 および TH5。 | 同じ TH4 および TH5 ハードウェア、新規シリコンは不要。 |
| 関係 | 各スイッチでの独立した判断。 | DLB 上に重ねて構成され、置き換えはしません。 |
ファブリック全体の情報に基づくひとつの判断
GLB は運用者がすでに稼働させているアダプティブルーティングの仕組みを再利用し、その上にファブリック全体の認識を追加します。DLB と RoCEv2 の上に直接構築されます。
DLB の判断
GLB は次を拡張します DLB フローレット判断を置き換えるのではなく拡張します。混在ファブリックも正しく動作します。GLB 非対応のスイッチは、ローリングアップグレード中に単にローカルのみのパス品質を寄与するだけです。
ロスレス RoCEv2 ファブリック
GLB はフローレット境界で再バインドし、次が必要とする順序どおりの配送を維持します RoCEv2 RDMA が必要とする。トランスポートは本番グレードのままで、パスの入力だけがより賢くなります。
Tomahawk 4 および Tomahawk 5 スイッチ
GLB の対象は、同じ Broadcom Tomahawk 4 および Tomahawk 5 オープンスイッチで、現在 DLB が動作しているものです。そのため、ハードウェアの変更ではなくソフトウェアのアップグレードとして提供されます。
計画中の GLB 実装がどのように組み合わさるか
GLB は、オープンな Broadcom ベースのハードウェア上でネットワークオペレーティングシステムとして動作する OcNOS によって有効化されます。この設計はコントロールプレーンを静穏に保ち、運用者がファブリックの判断を信頼するために必要なテレメトリを提供します。
パス品質のパブリッシュ
すべての spine と super-spine は、ポート単位のキュー占有率と利用率の差分をファブリック全体の隣接関係へ公開します。更新は既存のインバンドシグナリング上でサブミリ秒単位で行われ、コントロールプレーンの余分な通信は発生しません。
エンドツーエンドのアグリゲーション
ingress leaf は、ローカルイグレスの品質と下流のテレメトリを組み合わせ、候補パスごとの集約スコアを算出します。最悪のホップがスコアを支配します。これは運用者がトラブルシューティング時に用いるのと同じ直感です。
フローレット単位
DLBと同様に、GLBはフローレット境界で再バインドし、RoCEv2およびTCPの順序保証を維持します。違いは判断の入力情報にあり、ローカルポートの品質ではなくファブリック全体の品質を用います。
DLB上に階層化
GLB は DLB の判断を拡張するものであり、置き換えるものではありません。GLB 対応スイッチと DLB のみのスイッチが混在するファブリックも正しく動作するため、7.0 からのブラウンフィールドアップグレードも安全です。
最大16k-GPUの上限まで
リファレンスデザインでは、それぞれが 64x800G Tomahawk 5 である 256 台の spine スイッチと 128 台の super-spine スイッチを用い、16,384-GPU のアーキテクチャ上限に合わせてサイジングしています。
運用チームのためのgNMI
パスごとのスコア、再バインドイベント、最悪ホップの帰属情報が gNMI と OpenConfig 経由でストリーミングされるため、SRE はブラックボックスなしにファブリックの判断を xCCL コレクティブジョブの挙動と相関付けできます。
GLB 提供時に期待できること
GLB は OcNOS 7.1 ロードマップに含まれます。運用者がすでに稼働させているのと同じハードウェアとライセンスを対象とするため、その採用はフォークリフト交換ではなくアップグレードにとどまります。
- OcNOS 7.1 ロードマップ。 GLB は、本日 DLB を稼働させているのと同じ TH4 および TH5 ハードウェア上の 7.1 OcNOS-DC train を対象とします。スケジュールと機能範囲は次をご覧ください OcNOS リリースページ.
- 同一SKU。 OcNOS-DC PLUS 向けに計画中。機能ごとの課金障壁はなく、アップグレード時の新規ライセンスキーも不要です。
- 無停止アップグレード。 7.0から7.1へのブラウンフィールドアップグレードに対応。バージョン混在ファブリックは、アップグレード期間中はDLBのみの挙動で動作を継続。
- アーキテクチャレビューをご利用いただけます。 1,000 を超える GPU ファブリックのサイジングをご検討の場合、GLB テレメトリプレーンを含むサイジング作業を実施します。次で一次案の leaf-spine レイアウトをご入手ください AI ファブリックデザインスイート.
本日は DLB が土台、次に GLB が上限を引き上げる
アダプティブルーティングは、2-tier 規模で実際のテールレイテンシをすでに解決しています。GLB は、その同じ規律を、最大規模のクラスターが存在する 3-stage ファブリックへと、すでに検証済みのオープンハードウェア上で引き上げます。
DLB が一般的なケースを解決
2-tier leaf-spine および leaf から spine へのホップでは、ローカルなアダプティブルーティングがすでに大半の ECMP 衝突を解消します。これは本日 TH4 および TH5 上で出荷されています。
GLB が規模のケースを解決
1,024 GPU 以上では、マルチホップホットスポットが主要な外れ値となります。GLB はパス全体をスコアリングするため、ingress leaf はクリーンなアップリンクを追って輻輳したダウンリンクへ行き着くことをやめます。
OcNOS がイネーブラー
ひとつの NOS、ひとつの機能ロードマップ。現在は DLB、次は GLB、全体を通じてロスレス RoCEv2 を、シングルベンダーファブリックではなく検証済みオープンハードウェア上で提供します。
グローバルロードバランシングにお答えします
GLB は DLB とどう違いますか。
GLBはいつ利用可能になりますか。
GLB を使用するには DLB を置き換える必要がありますか。
GLB はどの程度の規模のファブリックをサポートしますか。
さらに詳しく。資料をお持ち帰りください。
製品データシートと、このページよりもさらに踏み込んだ簡潔で技術的なダウンロード資料です。
OcNOS-DC データシート
OcNOS-DC の完全な仕様。EVPN-VXLAN と Ethernet for AI の機能セット、ソフトウェア SKU、サポート対象ハードウェアプラットフォーム、ソリューション発注ガイドを収録しています。
データシートを入手OcNOS 800G ロスレス AI Fabric
Broadcom Tomahawk 4/5 スパインによるノンブロッキング RoCEv2 ファブリック。SKU 階層・検証済みプラットフォーム・導入アーキテクチャを解説します。
概要資料を入手EVPN-VXLAN データセンターファブリック
キャリアグレードの leaf-spine データセンターファブリック。対称型 IRB、Type-2/Type-5 ルート、そして分散エニーキャストゲートウェイ。
概要資料を入手OcNOS-DC データシート
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
OcNOS 800G ロスレス AI Fabric
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
EVPN-VXLAN データセンターファブリック
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
数千 GPU 規模のファブリックをサイジング中ですか。共に試算しましょう
ワークロードと GPU 規模をお知らせいただければ、IP Infusion のエンジニアが GLB テレメトリプレーンを共にサイジングします。あるいは AI ファブリックデザインスイートで一次案の leaf-spine レイアウトから始めることもできます。
OcNOS で AI ファブリック全体を設計
ビジネスケースからポート数の計算まで、構築のどの段階からでも着手できます。