AIネットワーキングスイッチとは?
AIネットワーキングスイッチとは、AIバックエンドファブリックでGPUサーバーを接続する、高radixのデータセンター向けEthernetスイッチ(通常はポートあたり400Gまたは800G)です。学習ジョブの所要時間は最も遅いフローで決まるため、PFC、ECN、適応型ロードバランシングによってRDMAトラフィックをロスレスに保ちます。 IP Infusionは、これらのスイッチを動かすネットワークオペレーティングシステムOcNOS-DCを開発し、51.2 TbpsのBroadcom Tomahawk 5プラットフォームおよび25.6 Tbps・12.8 Tbpsのプラットフォーム上で、検証済みの完成システムとして提供します。
データセンタースイッチをAIスイッチたらしめるもの
スイッチがAI対応と呼べるのは、学習クラスターが必要とする速度、規模、損失率でGPUトラフィックを伝送できる場合です。5つの特性がそれを決めます。これらのスイッチが構成するネットワークについては、次で解説しています: AI ファブリックとは何か。本ページはスイッチそのものを扱います。
- ポート速度と容量: GPUのNICは400Gと800Gで接続されるため、スイッチポートもそれに合わせる必要があります。51.2 Tbpsスイッチは800Gポートを64個、25.6 Tbpsスイッチは400Gポートを64個提供します。
- Radix(ポート数): スイッチあたりのポート数によって、1台のリーフが収容できるGPU数と、1台のスパインが接続できるリーフ数が決まり、それがファブリックに必要なティア数を決めます。ティアが少ないほど、ホップ数、光モジュール、消費電力が減ります。
- ロスレス伝送: GPUはRDMA over Converged Ethernet(RoCEv2)でデータを交換しますが、パケットがドロップすると大幅に低速化します。スイッチには、キューがあふれる前に一時停止させるPriority Flow Control(PFC)と、送信元に早期に警告するExplicit Congestion Notification(ECN)が必要で、NIC側の DCQCN 輻輳制御と連携して動作します。
- 負荷の均等化: AllReduceなどの集合通信は、少数の非常に大きなフローを生成します。静的ハッシュでは、そのうち2つが同じリンクに載り、別のリンクが遊休状態になることがあります。 動的ロードバランシング は、負荷の少ない経路へトラフィックを移します。
- 可視性: ストリーミングテレメトリ は、キューの深さ、PFCポーズ、ECNマークを発生と同時に報告するため、ジョブを遅くしている1本のリンクを運用者が特定可能。
AIネットワークファブリックにおけるAIスイッチの設置場所
AIデータセンターでは4つのネットワークが並行して稼働し、それぞれがスイッチに異なる要件を課します。一般にAIスイッチと言う場合、GPUバックエンドファブリックを指すことがほとんどです。
GPUバックエンドファブリック
学習と推論のために、サーバー間でGPUのNICを接続します。構成は レール最適化リーフとClosスパイン で、400Gまたは800Gで構築し、エンドツーエンドでロスレスに運用します。ポート速度とradixが最も重要になるのはこの部分です。
ストレージファブリック
学習データをGPUサーバーに供給し、チェックポイントを書き戻します。ここでも RoCEv2 を使うことが多く、GPU数ではなく持続的な帯域幅に合わせて規模を設計します。
フロントエンドネットワーク
クラスターをユーザー、オーケストレーション、データセンターの他の部分に接続します。一般的なリーフ・スパイン構成で、GPUクラウドではテナントを分離するために EVPN-VXLAN を併用することが多くあります。
アウトオブバンド管理
独立した 1Gネットワーク で、コンソール、サーバー管理コントローラー、スイッチ管理を担います。データプレーンが高負荷時や停止時にも、運用者はすべての機器に到達可能。
バックエンドファブリック内では、同じスイッチモデルをレールリーフ、スパイン、スーパースパインとして使用できます。レール最適化設計では、サーバー内の各GPU NICを別々のリーフに接続するため、同じランクのGPU間トラフィックは1ホップで届きます。ロールはトポロジーで決まります。これらの設計の詳細は AIファブリックトポロジー と レール最適化ネットワーク で解説しています。
AIスイッチを購入するのは、ネオクラウドやGPUクラウドのプロバイダー、大規模エンタープライズのデータセンターとMSP、そして自社データセンターにGPU容量を追加するサービスプロバイダーです。
800Gか400Gか:radixによるAIスイッチのサイジング
スイッチのポート数によって、次のティアが必要になるまでファブリックをどこまで拡張できるかが決まります。ノンブロッキングの2ティアリーフ・スパインでは、各リーフがポートをGPUとスパインに均等に割り当て、各スパインポートが1台のリーフに接続します。つまりkポートのスイッチは、2ティアではkの2乗を2で割った数、3ティアではkの3乗を4で割った数のエンドポイントをサポートします。
| スイッチ容量 | フルレートのポート数 | 2ティア、ノンブロッキング | 3ティア、ノンブロッキング |
|---|---|---|---|
| 51.2 Tbps | 800G×64 | 800Gで2,048エンドポイント | 800Gで65,536エンドポイント |
| 25.6 Tbps | 400G×64 | 400Gで2,048エンドポイント | 400Gで65,536エンドポイント |
| 12.8 Tbps | 400G×32 | 400Gで512エンドポイント | 400Gで8,192エンドポイント |
- これらは算術上の上限であり、 製品のスケール値ではありません。実際の設計では、オーバーサブスクリプション、サーバーあたりのレール数、光モジュールの到達距離、ラック電力によって変わります。
- 同じradixで800Gにすると、 ティアを増やさずにGPUあたりの帯域幅が2倍になります。800G NICを中心に構築するバックエンドファブリックが51.2 Tbpsスイッチを使うのはこのためです。
- IP Infusionのリファレンスデザイン (レール最適化型と3段Closファブリック向け、実際のポート数で規模を算出)は、次に掲載しています: AIファブリックトポロジー。設計の選び方は、次で順を追って解説しています: AIネットワーキングファブリックの選び方.
OcNOS-DC向けに検証済みのAIデータセンタースイッチ
OcNOS-DC は、IP Infusionのデータセンター・AIファブリック向けネットワークオペレーティングシステムです。Broadcomシリコンを搭載したオープンスイッチ上で動作し、以下のすべてのプラットフォームは OcNOSハードウェア互換性リストに掲載されています。同リストには合計40以上の検証済みプラットフォームが含まれます。
| 容量 | Broadcom ASIC | 検証済みプラットフォーム | AIデータセンターでの主な配置 |
|---|---|---|---|
| 51.2 Tbps | Tomahawk 5 (BCM78900) | Edgecore AIS800-64D、UfiSpace S9321-64E、UfiSpace S9321-64EO | 800Gバックエンドのリーフとスパイン。S9321-64EOはサイト間の コヒーレント DCI も伝送 |
| 25.6 Tbps | Tomahawk 4 (BCM56990) | Edgecore AS9736-64D(DCS520) | 400Gバックエンドファブリック、ストレージ、フロントエンド |
| 12.8 Tbps | Tomahawk 3 (BCM56980) | Edgecore AS9716-32D(DCS510) | 小規模ファブリックとフロントエンドネットワーク向けの400Gスパイン |
| 12.8 Tbps | Trident 4 (BCM56880) | Edgecore AS9726-32DB(DCS240)、UfiSpace S9300-32D | フロントエンドとストレージ向けの400Gリーフ、IPoDWDM対応 |
OcNOS-DCがスイッチにもたらすもの
- ロスレスRoCEv2: PFC(レイヤー3ルーテッドアンダーレイ上のPFCを含む)、 PFCデッドロックの検出と回復、DCQCNチューニング対応のECN、クラス別帯域幅のためのDCBXとETS。
- ロードバランシング: フローレットを考慮した適応ルーティングのためのDynamic Load Balancing(DLB)と、 グローバルロードバランシング(GLB) (OcNOS 7.1でファブリック全体の経路を最適化)。
- マルチテナントGPUクラウド: EVPN-VXLANにより、共有ファブリック上でテナントを分離します。Trident 3 X4、X5、X7およびTrident 4プラットフォームでは、ECNとPFC over VXLANにより、オーバーレイ全体で輻輳も通知します。
- 運用: gNMIとOpenConfigによるストリーミングテレメトリに加え、 NETCONF、YANG、ゼロタッチプロビジョニング.
- ライセンスとプラットフォーム対応: DLB、PFCデッドロックの検出と回復、ECN over VXLANはOcNOS-DC PLUSティアの機能で、対応状況はプラットフォームによって異なります。 OcNOS 機能マトリクス には、700以上の機能がプラットフォーム別・ティア別に掲載されています。
- 管理ネットワーク: 1G Trident 3 X2プラットフォーム(Edgecore AS4625-54T、Celestica DS1000、UfiSpace S6301-56ST、各120 Gbps)が、同じNOSでアウトオブバンドネットワークを運用します。
オープンなAIスイッチがもたらすもの、そして求めるもの
独立したネットワークオペレーティングシステムを備えたオープンスイッチでは、選択の場所と作業の場所が変わります。
得られるもの
- ハードウェアの選択: OcNOS-DCは複数のハードウェアメーカーのスイッチで動作するため、各プレーンを容量、光モジュール、リードタイムで選定可能。
- プレーンを横断する1つのNOS: バックエンド、ストレージ、フロントエンド、管理の各ネットワークが、1つのオペレーティングシステム、1つのCLI、1つの自動化モデルで動作します。
- 標準Ethernet: RoCEv2ファブリックはデータセンターの他の部分と同じ光モジュール、ケーブル、ツールを使用し、GPU NICはスイッチとは別に選定します。
- 新しいシリコンへの移行パス: 25.6 Tbpsから51.2 Tbpsへの移行で変わるのはスイッチであり、運用モデルではありません。
求めるもの
- インテグレーション。 ロスレスEthernetは、スイッチのバッファ、PFC、ECN、NICの輻輳制御を一体でチューニングして初めて機能します。そのチューニングを誰かが行い、責任を持つ必要があります。
- サポートモデル。 ハードウェアとソフトウェアの供給元が異なる場合、両者の境界をまたぐ障害には、明確な担当者が1人必要です。
- 検証の負担。 光モジュール、ケーブル、NICファームウェア、NOSリリースはそれぞれ時間とともに変化し、すべての組み合わせを本番投入前にテストする必要があります。
OcNOS Systems は、スイッチとOcNOS-DCを1つの検証済み完成システムとして導入準備済みの状態で出荷することで、この3点に対応します。サポート対象のプラットフォームと機能の組み合わせは、ハードウェア互換性リストと機能マトリクスで公開されています。
AIデータセンタースイッチの3つの購入方法
スイッチのシリコンは、どの選択肢でも同じであることが多くあります。違いは、誰がソフトウェアを選び、誰が各要素をインテグレーションし、誰がテストを担うかです。
| 質問 | 1社のメーカーによる統合型スイッチとNOS | 自社統合型オープンスイッチ | 検証済みオープンシステム |
|---|---|---|---|
| ハードウェアの選択 | メーカー独自のモデル | 購入者が選ぶ任意のオープンスイッチ | OcNOS HCL掲載のオープンスイッチ |
| ネットワークオペレーティングシステム | ハードウェアに紐づく | 購入者が選定・インストール | OcNOS-DC(そのプラットフォームで検証済み) |
| インテグレーションとテストの担い手 | メーカー | 購入者 | IP InfusionがプラットフォームとNOSの組み合わせを検証 |
| GPU NICの選択 | メーカーによって異なる | RoCEv2対応の任意のNIC | RoCEv2対応の任意のNIC |
| 作業負荷の所在 | インテグレーション負荷は低いが、選択肢は狭い | インテグレーション負荷は最大、選択肢は最も広い | インテグレーションは事前に完了、選択肢はHCLの範囲内 |
| 新しいシリコンへの移行 | メーカーがリリースしたとき | 購入者が検証したとき | プラットフォームがHCLに追加されたとき |
AIネットワーキングスイッチに関するよくある質問
AIスイッチとは?
AIに最適なスイッチは?
AIには800Gスイッチが必要?400Gで十分?
GPUファブリックスイッチとは?
AIスイッチにディープバッファは必要?
AIネットワークファブリックでInfiniBandの代わりにEthernetを使える?
AIファブリック向けにOcNOSが対応するスイッチは?
AIファブリックとオープンネットワーキングの関連情報
GPUクラスター向けのスイッチ選定なら、GPU数から始めましょう。
GPU数、NIC速度、許容できるオーバーサブスクリプションをお知らせください。IP Infusionのエンジニアが、OcNOS-DCを搭載した検証済みスイッチで、リーフ、スパイン、スーパースパインの各段の規模を算出します。
さらに詳しく。資料をお持ち帰りください。
本ページよりさらに踏み込んだ、短く技術的な 2 つのダウンロード。OcNOS-DC の完全なデータシートと、ロスレス 800G AI ファブリックアーキテクチャです。
OcNOS-DC データシート
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。
OcNOS 800G ロスレス AI Fabric
簡単なフォームです。送信後すぐに PDF が新しいタブで開きます。
✓ PDF を新しいタブで開いています…
開かない場合は、下記のリンクをご利用ください。