RoCEv2 · PFC / ECN · DCQCN

AI クラスター向け RoCE 対 InfiniBand

RoCEv2 は RDMA をオープンでマルチベンダーな Ethernet 上で動作させます。一方 InfiniBand はシングルベンダーのロスレスファブリックです。 RoCEv2 は PFC と ECN によってロスレスを維持し、DCQCN によって輻輳を制御します。一方 InfiniBand はクレジットベースのフロー制御によって設計上ロスレスです。大半の AI ワークロードにおいて、RoCEv2 を用いた Ethernet は今やハードウェアの選択肢を保ちながら InfiniBand に匹敵します。本ページでは両者を軸ごとに比較します。

UDP 4791Layer 3 でルーティング可能な RDMA
最大 800Gオープンな RoCEv2 ファブリック
1 つの契約OcNOS-DC + 検証済みハードウェア
600+OcNOS 上のオペレーターネットワーク
2 つのファブリック、ロスレスを維持する 2 つの方式

同一の GPU、ロスレスを維持する 2 つの方式

左:Ethernet 上の RoCEv2 は、ホップごとの PFC ポーズ、スイッチ上での ECN マーキング、送信 NIC 側での DCQCN レート制御によってキューを浅く保ちます。右:InfiniBand はクレジットベースのフロー制御を用い、受信側がバッファクレジットを通知した場合にのみ送信します。両者ともドロップを回避します。一方はオープンでマルチベンダーな Ethernet 上で、もう一方はシングルベンダーのファブリック上で実現します。

RoCEv2 の PFC/ECN/DCQCN ループと InfiniBand のクレジットベースのフロー制御の比較 2 つの図を並べて示しています。左:送信側 GPU NIC と受信側 GPU NIC が、OcNOS-DC を実行する Ethernet スイッチを介して接続されています。PFC ポーズはホップごとに作用し、スイッチは輻輳時に ECN をマーキングし、DCQCN の信号が送信側 NIC に戻ってレートを下げさせます。右:InfiniBand のスイッチとアダプターがバッファクレジットをやり取りし、送信側は受信側がクレジットを通知したときだけ送信します。下部の帯は、オープンなマルチベンダーの Ethernet とシングルベンダーの InfiniBand ファブリックを対比しています。 RoCEv2 · OPEN ETHERNET INFINIBAND · シングルベンダー GPU NIC送信側 スイッチOcNOS-DC · TH5 GPU NIC受信側 ECN マーキング PFC ポーズ(ホップごと) 送信側への DCQCN レート制御 PFC と ECN でファブリックをロスレスに保持 · DCQCN で輻輳を制御 IB スイッチサブネットマネージャー GPU HCAIB アダプター データ(クレジット > 0 の場合のみ) バッファクレジット クレジットベースのフロー制御 · 設計上ロスレス · 単一のエコシステム オープンなマルチベンダーの ETHERNET とシングルベンダーの INFINIBAND ファブリック
両者の比較

RoCE と InfiniBand、軸ごとの比較

RoCE は RDMA over Converged Ethernet であり、AI にとって重要なバージョンは RoCEv2 です。これは RDMA を宛先ポート 4791 で UDP/IP にカプセル化し、トラフィックを Layer 3 Ethernet ファブリック全体でルーティング可能にします。InfiniBand は InfiniBand Trade Association による専用設計のインターコネクトであり、クレジットベースのフロー制御によってアーキテクチャ上ロスレスです。AI クラスターにとっての実際的な問いは、コスト・サプライチェーン・運用を健全に保ちながら、どのトランスポートがワークロードを満たすかという点です。

観点 RoCEEthernet 上の RoCEv2、オープン InfiniBandシングルベンダーのファブリック
トランスポートと標準UDP/IP 上の RDMA(RoCEv2、IBTA)で、宛先 UDP ポート 4791 で Layer 3 ルーティング可能。標準の IEEE Ethernet 上で動作します。専用設計の InfiniBand リンク層およびトランスポート層(IBTA)で、専用スイッチとホストチャネルアダプターを備えます。
無損失を維持する仕組みホップバイホップのフロー制御にはPFC、エンドツーエンドの輻輳制御にはDCQCNを備えたECNを用い、スイッチキューを浅く保つことでRDMAのドロップを回避。クレジットベースのフロー制御。送信側は通知された受信側バッファクレジットに対してのみ送信するため、ファブリックは設計上無損失。
エコシステムあらゆるレイヤーでオープンかつマルチベンダー。スイッチASIC・スイッチ・NIC・NOS・光部品を独立したサプライヤーから調達可能。NICとスイッチシリコンは実質的にシングルベンダー。ファブリック・アダプター・管理が一体のスタックとして提供される。
スイッチシリコンの選択肢Edgecore・UfiSpaceをはじめとする各プラットフォームにわたるBroadcom Tomahawk 5(51.2 Tbps、64x800G)およびTomahawk 4(25.6 Tbps、64x400G)。シリコンはInfiniBandベンダーのみから供給。独立したASICやスイッチの供給はなし。
輻輳制御エンドツーエンドのDCQCN。スイッチがECNをマークし、送信側NICがレートを下げる。適応型ロードバランシング(DLB)がフローを分散し、ローカルな輻輳に応じて再調整する。仕様に組み込まれた適応型ルーティングを備えたクレジットベースのフロー制御。
規模Tomahawk 5 では、2 層ファブリックで 1:1 の場合に約 2,048 GPU(800G ブレークアウトで 8,000 以上)に到達し、3 段 Clos では 16,000 以上、最大約 65,536 エンドポイントまで拡張できます。単一ベンダーのファブリック内で、集中型サブネットマネージャーが管理するファットツリートポロジによってスケール。
運用とツール標準的なEthernet運用。BGP・EVPN・gNMI/OpenConfigテレメトリ、そしてデータセンター全体で用いられるのと同じ自動化(Ansible・NETCONF)。データセンターの他の運用モデルとは分離された、専用のInfiniBandツールとサブネットマネージャー。
ベンダーロックイン本質的にロックインなし。ハードウェアとソフトウェアを自由に組み合わせ、サプライチェーンをセカンドソース化可能。高い。NIC・スイッチ・配線・管理は通常、単一ベンダーから提供される。
コストの傾向400Gおよび800GでOcNOS-DCを動作させるオープンハードウェアのspineは、シングルベンダーファブリックを大幅に下回るコストを実現し、ポート速度が上がるほどその差は拡大。シングルベンダーの価格は、同等の容量に対して割高。

InfiniBandはInfiniBand Trade Associationの商標です。NVIDIAおよびMellanoxはそれぞれの所有者の商標です。この比較は情報提供を目的としたものであり、提携や推奨を示すものではありません。

選択

それぞれが適する領域

適切な答えはワークロード固有です。絶対的なレイテンシの下限が要件となる場合はInfiniBandを、運用モデル・コスト・拠点間のリーチが決め手となる場合はRoCEを選択してください。

InfiniBandが適する場合

レイテンシの下限が仕様要件

総所有コストよりもNIC間レイテンシの絶対的な下限が重視される密結合HPCシミュレーション、およびシングルベンダースタックが許容される専有シングルテナントクラスター。

RoCEが適する場合

運用とサプライチェーンが重要

データセンターの他の部分と、単一の運用モデル・単一のツールスタック・マルチベンダーのサプライチェーンを共有するマルチテナントのGPU-as-a-ServiceおよびAI back-end。

RoCEが適する場合

GPUあたりのコストが決め手

オープンハードウェアのspineとOcNOS-DCにより、シングルベンダーのネットワーク割増コストを排除。数千GPU規模の構築では、これはハードウェア予算の相当な割合を占める。

RoCEが適する場合

ファブリックがデータセンターにまたがる

Ethernetは400G ZR/ZR+コヒーレント光を用いて、別個の長距離ゲートウェイレイヤーなしに、ホール間および地域間へと自然に拡張。

オープンな道筋

OcNOS-DCがRoCEv2の道筋を実現する仕組み

OcNOS-DCはRoCEv2が必要とする無損失Ethernet基盤を提供します。スイッチが損失回避と輻輳制御のプリミティブを供給し、RoCEv2はNIC上で動作するトランスポートです。これらは現在OcNOS-DCで検証済みのスイッチ機能です。

ロスレス性

PFC と ECN

プライオリティフロー制御。これにはDCBX/LLDPを用いたLayer 3上のPFC-with-QoS、さらにECNおよびDynamic ECNが含まれ、RDMAフローがドロップなしに浅いキューを維持します。

輻輳

DCQCNマーキング

スイッチがECNをマークすることで、エンドツーエンドの NICとスイッチによるDCQCNループ が送信側のレートを制限可能。ETSとWREDがRDMAを運ぶキューをシェーピングし管理します。

ロードバランシング

DLBとRTAG7

ダイナミックロードバランシング (Reactive Path RebalanceおよびRandom Flowを含む)はRTAG7ハッシングと組み合わせてコレクティブを分散し、ローカルな輻輳に応じて再調整します。

耐障害性

PFCデッドロック保護

PFCデッドロック検出とリカバリ とバッファチューニングにより、PFCが生じさせ得るポーズ伝播下でも無損失ファブリックを安定に保ちます。

テレメトリ

gNMI/OpenConfig

ストリーミング gNMIおよびOpenConfigテレメトリ はクラスターの立ち上げおよび定常運用時のクローズドループチューニングに向けて、プライオリティ単位の可視性を提供します。

標準

Ultra Ethernet Consortium メンバー

IP Infusion は Ultra Ethernet Consortium(UEC)のメンバーです。UEC 1.0 が定義するのは マルチパスのイーサネットトランスポート で、1 つのフローを多数のパスに分散し、UEC 対応 NIC 上で動作します。

シリコンの選択はオープンです。OcNOS-DCは、Broadcom Tomahawk 5上のEdgecore AIS800-64DおよびUfiSpace S9321-64E/S9321-64EO(-64EOは400G ZR+を追加)、そしてTomahawk 4上のEdgecore AS9736-64Dで動作し、いずれもRoCEv2向けにチューニングされたオンチップかつ共有バッファのプラットフォームです。1つのIP Infusion契約でソフトウェアと検証済みハードウェアを、1つのTACと1つのSLAでカバーします。

なぜ移行が進むのか

多くのオペレーターがAI back-endにEthernetへ移行する理由

この移行は、素のレイテンシよりも運用面と経済面によるものです。大規模構築では3つの要素が急速に効いてきます。データセンターの他の部分と共有される単一のネットワークモデル、マルチベンダーのサプライチェーン、そして400Gおよび800Gにおけるポートあたりの低コストです。

その規模は現場で実証済みです。Metaは、かつてInfiniBandが必要とされると考えられていた24,000 GPUクラスター上のRoCE Ethernet ファブリックで、最大規模のモデルをトレーニングしたことを明らかにしています。Tomahawk 4およびTomahawk 5の適応型ロードバランシングはリアルタイムの輻輳に応じてフローを再割り当てするため、静的ハッシングでは活用しきれない状況でも、適切に運用されたファブリックは90 percentを超える利用率を目標にできます。90 percentは設計目標であり、測定された保証値ではありません。

InfiniBandに残る優位性、すなわちより低い絶対レイテンシの下限は、一部の密結合HPCワークロードにおいては依然として重要です。しかし大規模な分散トレーニングおよび推論のコレクティブの大半では、適切にチューニングされたRoCEv2 ファブリックはジョブ完了時間を左右するしきい値を下回ります。だからこそ、新規のAI back-end構築の多くは、いまや運用面と経済面の観点によって決まるのです。

  • データセンターの他の部分と共有される単一のネットワークモデル。スキルとツールをそのまま活用可能。
  • シリコン・スイッチ・NIC・光部品をセカンドソース化できるマルチベンダーのサプライチェーン。
  • 400Gおよび800Gにおけるポートあたりの低コスト。より多くのGPU、より大規模なストレージ層、あるいは第2拠点への資本を確保。
要点

どちらも有効であり、新規のAI back-endの大半はEthernetに落ち着く

InfiniBandは、一部の密結合HPCワークロードが引き続き対価を払うだけの、より低い絶対レイテンシの下限を保っています。しかし大半のAI back-end構築では、運用面と経済面の観点がオープンEthernet上のRoCEv2を選ぶ決め手となります。

どちらも有効

InfiniBandは、一部の密結合HPCワークロードが引き続き対価を払うだけの、より低い絶対レイテンシの下限を保っています。

RoCEv2はAI向けの差を埋めた

PFC・ECN・DCQCN・適応型ロードバランシングを正しく構成すれば、Ethernetはハードウェアの選択肢を保ちつつ、大半の分散トレーニングコレクティブでInfiniBandに匹敵します。

決定は通常、運用面によるもの

単一のネットワークモデル、マルチベンダーのサプライチェーン、そして400Gおよび800Gにおけるポートあたりの低コストが、新規のAI back-end構築の大半を決定づけます。

OcNOS-DC はオープンな道筋

Edgecore と UfiSpace の検証済みオープンハードウェア上で、実証済みの RoCEv2 プリミティブを今すぐ利用可能。OcNOS Systems なら 1 つの契約、1 つの TAC、1 つの SLA。

リソース

AIファブリックリファレンスデザインを入手

PDF 全文:ロスレス RoCEv2 トポロジー、スイッチとトランシーバーの数量、検証済みプラットフォーム、OcNOS-DC 上の DCQCN の初期プロファイル。

PDF をダウンロード

RoCE対InfiniBand FAQ

RoCEとInfiniBandの違いは何ですか。
RoCE(実際にはRoCEv2)は、標準的でルーティング可能なEthernetおよびIP上でRDMAを運ぶため、どのベンダーでも供給できるスイッチ・NIC・光部品・運用ツールを再利用できます。InfiniBandは、単一ベンダーによる独自のスイッチ・アダプター・配線・サブネットマネージャーを備えた、別個の専用ファブリックです。RoCEv2はPFCとECNでファブリックを無損失に保ち、DCQCNで輻輳を制御しますが、InfiniBandは設計上無損失であるクレジットベースのフロー制御に依拠します。
EthernetはAI向けにInfiniBandと同等の速さですか。
大規模な分散トレーニングコレクティブの大半では、そのとおりです。InfiniBandは依然として数百ナノ秒だけ低い絶対レイテンシの下限を持ちますが、RoCEv2をPFC・ECN・DCQCN・適応型ロードバランシングで構成すれば、その差は大半のAIワークロードにおいてジョブ完了時間を左右する水準を下回ります。多くのオペレーターがこの理由から、いまや大規模なAI back-endネットワークをEthernet上で運用しています。
RoCEv2 とは何ですか。
RoCEv2(RDMA over Converged Ethernet version 2)は、宛先ポート4791のUDP/IPにRDMAをカプセル化するため、RDMAトラフィックはLayer 3 Ethernet ファブリック全体でルーティング可能です。GPUとストレージが低レイテンシかつ低CPUオーバーヘッドでメモリ間を直接データ移動できるようにするもので、これがオープンなマルチベンダーEthernetネットワーク上でRDMAを動作させる主流の方法である理由です。
RoCEには無損失ファブリックが必要ですか。
はい。RoCEv2はパケットがドロップされると性能が急激に低下するため、無損失またはほぼ無損失のファブリックが必要です。オペレーターは、ホップバイホップのフロー制御にPFC、エンドツーエンドの輻輳制御にDCQCNを備えたECNを用いてこれを実現し、スイッチキューを浅く保つことでRDMAフローのドロップと再送を回避します。スイッチが無損失の基盤を供給し、RoCEv2はNIC上で動作するトランスポートです。
RoCEをオープンスイッチ上で動作させられますか。
はい。RoCEv2は標準的なEthernetシリコン上で動作します。OcNOS-DCは、RoCEv2の構成要素(PFC、Layer 3上のPFC-with-QoS、ECN、Dynamic ECN、ETS、WRED、DLB、PFCデッドロック検出とリカバリ、そしてgNMI/OpenConfigテレメトリ)を、Broadcom Tomahawk 4およびTomahawk 5をベースとしたEdgecore・UfiSpaceプラットフォームなどの検証済みオープンハードウェア上で提供します。1つのIP Infusion契約でソフトウェアと検証済みハードウェアをカバーします。
Ultra Ethernetについてはどうですか。
Ultra Ethernet(UEC)は、パケットスプレー・マルチパスRDMA・順序外配信・最新の輻輳制御をEthernetにもたらすオープン標準であり、かつてInfiniBandだけが担っていた領域を狭めています。IP InfusionはUltra Ethernet Consortiumのメンバーであり、OcNOS-DCはBroadcom Tomahawk 4およびTomahawk 5スイッチ上で、PFC、ECN、DCQCN、ミリ秒未満のDLBによるロスレスRoCEv2を現在本番環境で稼働させています。

InfiniBandと比較してRoCEv2 ファブリックのサイジングをご検討ですか。ワークロード固有の計算を実施しましょう

ワークロードとGPU規模をお知らせいただければ、IP Infusionのエンジニアが一緒に数値を算出します。あるいはAI Fabric Design Suiteで初回のleaf-spineレイアウトから始めることもできます。