ネットワーキング用語 · 800G · RoCEv2

AIネットワーキングスイッチとは?

AIネットワーキングスイッチとは、AIバックエンドファブリックでGPUサーバーを接続する、高radixのデータセンター向けEthernetスイッチ(通常はポートあたり400Gまたは800G)です。学習ジョブの所要時間は最も遅いフローで決まるため、PFC、ECN、適応型ロードバランシングによってRDMAトラフィックをロスレスに保ちます。 IP Infusionは、これらのスイッチを動かすネットワークオペレーティングシステムOcNOS-DCを開発し、51.2 TbpsのBroadcom Tomahawk 5プラットフォームおよび25.6 Tbps・12.8 Tbpsのプラットフォーム上で、検証済みの完成システムとして提供します。

51.2 TbpsTomahawk 5 プラットフォーム
800Gスイッチあたり64ポート
RoCEv2ロスレス Ethernet トランスポート
40+検証済みプラットフォーム
定義

データセンタースイッチをAIスイッチたらしめるもの

スイッチがAI対応と呼べるのは、学習クラスターが必要とする速度、規模、損失率でGPUトラフィックを伝送できる場合です。5つの特性がそれを決めます。これらのスイッチが構成するネットワークについては、次で解説しています: AI ファブリックとは何か。本ページはスイッチそのものを扱います。

  • ポート速度と容量: GPUのNICは400Gと800Gで接続されるため、スイッチポートもそれに合わせる必要があります。51.2 Tbpsスイッチは800Gポートを64個、25.6 Tbpsスイッチは400Gポートを64個提供します。
  • Radix(ポート数): スイッチあたりのポート数によって、1台のリーフが収容できるGPU数と、1台のスパインが接続できるリーフ数が決まり、それがファブリックに必要なティア数を決めます。ティアが少ないほど、ホップ数、光モジュール、消費電力が減ります。
  • ロスレス伝送: GPUはRDMA over Converged Ethernet(RoCEv2)でデータを交換しますが、パケットがドロップすると大幅に低速化します。スイッチには、キューがあふれる前に一時停止させるPriority Flow Control(PFC)と、送信元に早期に警告するExplicit Congestion Notification(ECN)が必要で、NIC側の DCQCN 輻輳制御と連携して動作します。
  • 負荷の均等化: AllReduceなどの集合通信は、少数の非常に大きなフローを生成します。静的ハッシュでは、そのうち2つが同じリンクに載り、別のリンクが遊休状態になることがあります。 動的ロードバランシング は、負荷の少ない経路へトラフィックを移します。
  • 可視性: ストリーミングテレメトリ は、キューの深さ、PFCポーズ、ECNマークを発生と同時に報告するため、ジョブを遅くしている1本のリンクを運用者が特定可能。
設置場所

AIネットワークファブリックにおけるAIスイッチの設置場所

AIデータセンターでは4つのネットワークが並行して稼働し、それぞれがスイッチに異なる要件を課します。一般にAIスイッチと言う場合、GPUバックエンドファブリックを指すことがほとんどです。

GPUバックエンドファブリック

学習と推論のために、サーバー間でGPUのNICを接続します。構成は レール最適化リーフとClosスパイン で、400Gまたは800Gで構築し、エンドツーエンドでロスレスに運用します。ポート速度とradixが最も重要になるのはこの部分です。

ストレージファブリック

学習データをGPUサーバーに供給し、チェックポイントを書き戻します。ここでも RoCEv2 を使うことが多く、GPU数ではなく持続的な帯域幅に合わせて規模を設計します。

フロントエンドネットワーク

クラスターをユーザー、オーケストレーション、データセンターの他の部分に接続します。一般的なリーフ・スパイン構成で、GPUクラウドではテナントを分離するために EVPN-VXLAN を併用することが多くあります。

アウトオブバンド管理

独立した 1Gネットワーク で、コンソール、サーバー管理コントローラー、スイッチ管理を担います。データプレーンが高負荷時や停止時にも、運用者はすべての機器に到達可能。

バックエンドファブリック内では、同じスイッチモデルをレールリーフ、スパイン、スーパースパインとして使用できます。レール最適化設計では、サーバー内の各GPU NICを別々のリーフに接続するため、同じランクのGPU間トラフィックは1ホップで届きます。ロールはトポロジーで決まります。これらの設計の詳細は AIファブリックトポロジー と レール最適化ネットワーク で解説しています。

AIスイッチを購入するのは、ネオクラウドやGPUクラウドのプロバイダー、大規模エンタープライズのデータセンターとMSP、そして自社データセンターにGPU容量を追加するサービスプロバイダーです。

サイジング

800Gか400Gか:radixによるAIスイッチのサイジング

スイッチのポート数によって、次のティアが必要になるまでファブリックをどこまで拡張できるかが決まります。ノンブロッキングの2ティアリーフ・スパインでは、各リーフがポートをGPUとスパインに均等に割り当て、各スパインポートが1台のリーフに接続します。つまりkポートのスイッチは、2ティアではkの2乗を2で割った数、3ティアではkの3乗を4で割った数のエンドポイントをサポートします。

スイッチ容量フルレートのポート数2ティア、ノンブロッキング3ティア、ノンブロッキング
51.2 Tbps800G×64800Gで2,048エンドポイント800Gで65,536エンドポイント
25.6 Tbps400G×64400Gで2,048エンドポイント400Gで65,536エンドポイント
12.8 Tbps400G×32400Gで512エンドポイント400Gで8,192エンドポイント
  • これらは算術上の上限であり、 製品のスケール値ではありません。実際の設計では、オーバーサブスクリプション、サーバーあたりのレール数、光モジュールの到達距離、ラック電力によって変わります。
  • 同じradixで800Gにすると、 ティアを増やさずにGPUあたりの帯域幅が2倍になります。800G NICを中心に構築するバックエンドファブリックが51.2 Tbpsスイッチを使うのはこのためです。
  • IP Infusionのリファレンスデザイン (レール最適化型と3段Closファブリック向け、実際のポート数で規模を算出)は、次に掲載しています: AIファブリックトポロジー。設計の選び方は、次で順を追って解説しています: AIネットワーキングファブリックの選び方.
OcNOSプラットフォーム

OcNOS-DC向けに検証済みのAIデータセンタースイッチ

OcNOS-DC は、IP Infusionのデータセンター・AIファブリック向けネットワークオペレーティングシステムです。Broadcomシリコンを搭載したオープンスイッチ上で動作し、以下のすべてのプラットフォームは OcNOSハードウェア互換性リストに掲載されています。同リストには合計40以上の検証済みプラットフォームが含まれます。

容量Broadcom ASIC検証済みプラットフォームAIデータセンターでの主な配置
51.2 TbpsTomahawk 5 (BCM78900)Edgecore AIS800-64D、UfiSpace S9321-64E、UfiSpace S9321-64EO800Gバックエンドのリーフとスパイン。S9321-64EOはサイト間の コヒーレント DCI も伝送
25.6 TbpsTomahawk 4 (BCM56990)Edgecore AS9736-64D(DCS520)400Gバックエンドファブリック、ストレージ、フロントエンド
12.8 TbpsTomahawk 3 (BCM56980)Edgecore AS9716-32D(DCS510)小規模ファブリックとフロントエンドネットワーク向けの400Gスパイン
12.8 TbpsTrident 4 (BCM56880)Edgecore AS9726-32DB(DCS240)、UfiSpace S9300-32Dフロントエンドとストレージ向けの400Gリーフ、IPoDWDM対応

OcNOS-DCがスイッチにもたらすもの

  • ロスレスRoCEv2: PFC(レイヤー3ルーテッドアンダーレイ上のPFCを含む)、 PFCデッドロックの検出と回復、DCQCNチューニング対応のECN、クラス別帯域幅のためのDCBXとETS。
  • ロードバランシング: フローレットを考慮した適応ルーティングのためのDynamic Load Balancing(DLB)と、 グローバルロードバランシング(GLB) (OcNOS 7.1でファブリック全体の経路を最適化)。
  • マルチテナントGPUクラウド: EVPN-VXLANにより、共有ファブリック上でテナントを分離します。Trident 3 X4、X5、X7およびTrident 4プラットフォームでは、ECNとPFC over VXLANにより、オーバーレイ全体で輻輳も通知します。
  • 運用: gNMIとOpenConfigによるストリーミングテレメトリに加え、 NETCONF、YANG、ゼロタッチプロビジョニング.
  • ライセンスとプラットフォーム対応: DLB、PFCデッドロックの検出と回復、ECN over VXLANはOcNOS-DC PLUSティアの機能で、対応状況はプラットフォームによって異なります。 OcNOS 機能マトリクス には、700以上の機能がプラットフォーム別・ティア別に掲載されています。
  • 管理ネットワーク: 1G Trident 3 X2プラットフォーム(Edgecore AS4625-54T、Celestica DS1000、UfiSpace S6301-56ST、各120 Gbps)が、同じNOSでアウトオブバンドネットワークを運用します。
メリットとトレードオフ

オープンなAIスイッチがもたらすもの、そして求めるもの

独立したネットワークオペレーティングシステムを備えたオープンスイッチでは、選択の場所と作業の場所が変わります。

得られるもの

  • ハードウェアの選択: OcNOS-DCは複数のハードウェアメーカーのスイッチで動作するため、各プレーンを容量、光モジュール、リードタイムで選定可能。
  • プレーンを横断する1つのNOS: バックエンド、ストレージ、フロントエンド、管理の各ネットワークが、1つのオペレーティングシステム、1つのCLI、1つの自動化モデルで動作します。
  • 標準Ethernet: RoCEv2ファブリックはデータセンターの他の部分と同じ光モジュール、ケーブル、ツールを使用し、GPU NICはスイッチとは別に選定します。
  • 新しいシリコンへの移行パス: 25.6 Tbpsから51.2 Tbpsへの移行で変わるのはスイッチであり、運用モデルではありません。

求めるもの

  • インテグレーション。 ロスレスEthernetは、スイッチのバッファ、PFC、ECN、NICの輻輳制御を一体でチューニングして初めて機能します。そのチューニングを誰かが行い、責任を持つ必要があります。
  • サポートモデル。 ハードウェアとソフトウェアの供給元が異なる場合、両者の境界をまたぐ障害には、明確な担当者が1人必要です。
  • 検証の負担。 光モジュール、ケーブル、NICファームウェア、NOSリリースはそれぞれ時間とともに変化し、すべての組み合わせを本番投入前にテストする必要があります。

OcNOS Systems は、スイッチとOcNOS-DCを1つの検証済み完成システムとして導入準備済みの状態で出荷することで、この3点に対応します。サポート対象のプラットフォームと機能の組み合わせは、ハードウェア互換性リストと機能マトリクスで公開されています。

比較

AIデータセンタースイッチの3つの購入方法

スイッチのシリコンは、どの選択肢でも同じであることが多くあります。違いは、誰がソフトウェアを選び、誰が各要素をインテグレーションし、誰がテストを担うかです。

質問1社のメーカーによる統合型スイッチとNOS自社統合型オープンスイッチ検証済みオープンシステム
ハードウェアの選択メーカー独自のモデル購入者が選ぶ任意のオープンスイッチOcNOS HCL掲載のオープンスイッチ
ネットワークオペレーティングシステムハードウェアに紐づく購入者が選定・インストールOcNOS-DC(そのプラットフォームで検証済み)
インテグレーションとテストの担い手メーカー購入者IP InfusionがプラットフォームとNOSの組み合わせを検証
GPU NICの選択メーカーによって異なるRoCEv2対応の任意のNICRoCEv2対応の任意のNIC
作業負荷の所在インテグレーション負荷は低いが、選択肢は狭いインテグレーション負荷は最大、選択肢は最も広いインテグレーションは事前に完了、選択肢はHCLの範囲内
新しいシリコンへの移行メーカーがリリースしたとき購入者が検証したときプラットフォームがHCLに追加されたとき

AIネットワーキングスイッチに関するよくある質問

AIスイッチとは?
AIスイッチとは、GPUバックエンドファブリック向けに設計されたデータセンター向けEthernetスイッチです。高radixの400Gまたは800Gポートを備え、PFCとECNによるロスレスRoCEv2に対応し、大きなフローをすべての経路に分散します。学習ジョブの所要時間は最も遅いフローで決まるためです。この用語は、スイッチの用途と対応機能を表すもので、独立したハードウェアのクラスを指すものではありません。
AIに最適なスイッチは?
適切なスイッチは、GPU数、NIC速度、許容できるファブリックのティア数によって決まります。800G NICの場合、800Gポートを64個備えた51.2 Tbpsスイッチは、2ティアのノンブロッキングファブリックで2,048エンドポイントという算術上の上限を持ちます。400G NICの場合は、25.6 Tbpsスイッチが400Gで同じradixを提供します。ポート速度以外に、PFCとECNへの対応、動的ロードバランシング、ストリーミングテレメトリ、そしてネットワークオペレーティングシステムがそのハードウェアで検証済みかどうかを確認してください。
AIには800Gスイッチが必要?400Gで十分?
スイッチはNICに合わせます。400G NICのクラスターには、25.6 Tbpsまたは12.8 Tbpsのスイッチが対応します。800G NICを中心に構築するクラスターには800Gのスイッチポートが必要で、そうでなければ各GPUが得られるネットワーク帯域幅は半分になります。実際には51.2 Tbpsスイッチを意味します。同じradixなら、800Gはファブリックのティアを増やさずにGPUあたりの帯域幅を2倍にします。
GPUファブリックスイッチとは?
GPUバックエンドネットワークにおけるAIスイッチの別名で、サーバー間でGPU NICを接続するリーフ、スパイン、スーパースパインのスイッチを指します。サーバー内やラック内では、GPUは別のスケールアップ用インターコネクトでも通信します。GPUファブリックスイッチが伝送するのは、サーバー間のスケールアウトトラフィックです。
AIスイッチにディープバッファは必要?
バックエンドファブリックでは通常不要です。ほとんどのAIバックエンドファブリックは、オンチップ共有バッファを持つ高radixスイッチを使用し、PFC、ECN、ロードバランシングでロスを防ぎます。ディープバッファスイッチは、データセンター相互接続やサービスプロバイダールーターなど、長距離のリンクや速度が異なるリンクからトラフィックが到着するネットワークのエッジでより一般的です。
AIネットワークファブリックでInfiniBandの代わりにEthernetを使える?
はい。RoCEv2は標準Ethernet上でRDMAを伝送し、PFC、ECN、ロードバランシングを組み合わせることで、EthernetファブリックはGPUトラフィックに対してロスレスに動作します。Ethernetなら、1つの運用チーム、1種類の光モジュール、1つのツールセットでバックエンドとフロントエンドの両ネットワークをカバーできます。
AIファブリック向けにOcNOSが対応するスイッチは?
GPUバックエンドファブリック向けには、OcNOS-DCは51.2 TbpsのBroadcom Tomahawk 5スイッチ(Edgecore AIS800-64D、UfiSpace S9321-64E、UfiSpace S9321-64EO)と、25.6 TbpsのTomahawk 4スイッチ(Edgecore AS9736-64D)で動作します。OcNOS-DCは、12.8 TbpsのTomahawk 3およびTrident 4スイッチ(Edgecore AS9716-32D、Edgecore AS9726-32DB、UfiSpace S9300-32D)でも検証済みです。40以上の検証済みプラットフォームの全一覧は、OcNOSのハードウェア互換性リストに掲載されています。
関連

AIファブリックとオープンネットワーキングの関連情報

AIファブリックとは?

これらのスイッチが構築するGPUバックエンドネットワーク。

AI ファブリックアーキテクチャ

AIデータセンターの各プレーンとそのハードウェア。

OcNOS AI Fabric

OcNOS-DCによる800G AIファブリックの全体像。

InfiniBand対イーサネット

AI向けに2つのトランスポートを比較。

ホワイトボックススイッチとは?

AIスイッチを支えるオープンハードウェアモデル。

ネットワークオペレーティングシステムとは?

シリコンをファブリックに変えるソフトウェア。

ネットワークディスアグリゲーションとは?

スイッチとそのソフトウェアを別々に購入すること。

オープンネットワーキング

オープンハードウェア、オープンソフトウェア、そしてIP Infusionの位置づけ。

ロスレスイーサネットとは?

PFC、ECN、DCQCNと、それらがロスを防ぐ仕組み。

GPUクラスター向けのスイッチ選定なら、GPU数から始めましょう。

GPU数、NIC速度、許容できるオーバーサブスクリプションをお知らせください。IP Infusionのエンジニアが、OcNOS-DCを搭載した検証済みスイッチで、リーフ、スパイン、スーパースパインの各段の規模を算出します。