AI 클러스터를 위한 RoCE vs InfiniBand
RoCEv2는 개방형 멀티벤더 이더넷 위에서 RDMA를 실행하며, InfiniBand는 단일 벤더 무손실 패브릭입니다. RoCEv2는 PFC와 ECN으로 무손실을 유지하고 DCQCN으로 혼잡을 제어하는 반면, InfiniBand는 크레딧 기반 흐름 제어를 통해 설계상 무손실입니다. 대부분의 AI 워크로드에서 RoCEv2를 갖춘 이더넷은 이제 하드웨어 선택권을 유지하면서 InfiniBand에 필적합니다. 이 페이지는 둘을 항목별로 비교합니다.
동일한 GPU, 무손실을 유지하는 두 가지 방식
왼쪽: 이더넷 위의 RoCEv2는 홉 단위 PFC 일시 정지, 스위치에서의 ECN 마킹, 그리고 송신 NIC에서의 DCQCN 전송률 제어로 큐를 얕게 유지합니다. 오른쪽: InfiniBand는 크레딧 기반 흐름 제어를 사용하여, 수신 측이 버퍼 크레딧을 광고했을 때만 전송합니다. 둘 다 드롭을 방지하지만, 하나는 개방형 멀티벤더 이더넷에서, 다른 하나는 단일 벤더 패브릭에서 그렇게 합니다.
RoCE와 InfiniBand, 항목별 비교
RoCE는 RDMA over Converged Ethernet이며, AI에서 중요한 버전은 RoCEv2로, RDMA를 목적지 포트 4791에서 UDP/IP로 인캡슐화하여 트래픽을 Layer 3 이더넷 패브릭 전반에서 라우팅할 수 있게 합니다. InfiniBand는 InfiniBand Trade Association의 전용 인터커넥트로, 크레딧 기반 흐름 제어를 통해 아키텍처적으로 무손실입니다. AI 클러스터에 대한 현실적인 질문은 비용, 공급망, 운영을 합리적으로 유지하면서 어떤 트랜스포트가 워크로드를 충족하는가입니다.
| Axis | RoCE이더넷 위의 RoCEv2, 개방형 | InfiniBand단일 벤더 패브릭 |
|---|---|---|
| Transport & standard | UDP/IP 위의 RDMA(RoCEv2, IBTA)로, 목적지 UDP 포트 4791에서 Layer 3 라우팅이 가능합니다. 표준 IEEE 이더넷 위에서 동작합니다. | 전용 스위치와 host channel adapter를 갖춘 목적 설계형 InfiniBand 링크 및 트랜스포트 계층(IBTA). |
| 무손실을 유지하는 방식 | 홉 단위 흐름 제어를 위한 PFC와 종단 간 혼잡 제어를 위한 ECN + DCQCN으로 스위치 큐를 얕게 유지하여 RDMA가 드롭을 피하도록 합니다. | 크레딧 기반 흐름 제어: 송신 측은 광고된 수신 측 버퍼 크레딧에 대해서만 전송하므로, 패브릭은 설계상 무손실입니다. |
| 에코시스템 | 모든 계층에서 개방형 멀티벤더: 스위치 ASIC, 스위치, NIC, NOS, 광 트랜시버가 독립적인 공급업체로부터 제공됩니다. | NIC 및 스위치 실리콘에서 사실상 단일 벤더이며, 패브릭, 어댑터, 관리가 하나의 스택으로 제공됩니다. |
| 스위치 실리콘 선택 | Edgecore 및 UfiSpace 플랫폼 등에서 Broadcom Tomahawk 5(51.2 Tbps, 64x800G) 및 Tomahawk 4(25.6 Tbps, 64x400G). | InfiniBand 벤더의 실리콘만 사용하며, 독립적인 ASIC 또는 스위치 공급이 없습니다. |
| 혼잡 제어 | 종단 간 DCQCN: 스위치가 ECN을 마킹하고 송신 NIC이 전송률을 낮춥니다. 적응형 로드 밸런싱(DLB)이 플로우를 분산하고 로컬 혼잡 시 재조정합니다. | 사양에 내장된 적응형 라우팅을 갖춘 크레딧 기반 흐름 제어. |
| Scale | Tomahawk 5에서 2계층 패브릭은 1:1로 약 2,048개 GPU에 도달하며(800G 분할 시 8,000개 이상으로), 3단계 Clos는 16,000개 이상, 최대 약 65,535개 엔드포인트까지 확장됩니다. | 단일 벤더 패브릭 내에서 중앙 집중식 서브넷 매니저가 관리하는 fat-tree 토폴로지를 통해 확장됩니다. |
| Operations & tooling | 표준 이더넷 운영: BGP, EVPN, gNMI/OpenConfig 텔레메트리, 그리고 데이터센터 전반에서 사용하는 동일한 자동화(Ansible, NETCONF). | 나머지 데이터센터의 운영 모델과 분리된, 전문화된 InfiniBand 도구와 서브넷 매니저. |
| 벤더 종속 | 본질적으로 없음: 하드웨어와 소프트웨어를 자유롭게 조합하고 공급망을 이중 소싱할 수 있습니다. | 높음: NIC, 스위치, 케이블링, 관리가 일반적으로 단일 벤더로부터 제공됩니다. |
| Cost trend | 400G 및 800G에서 OcNOS-DC를 실행하는 개방형 하드웨어 spine은 단일 벤더 패브릭보다 상당히 저렴하며, 포트 속도가 높아질수록 그 격차는 벌어집니다. | 단일 벤더 가격은 동등한 용량에 대해 프리미엄을 수반합니다. |
InfiniBand는 InfiniBand Trade Association의 상표입니다. NVIDIA와 Mellanox는 각 소유자의 상표입니다. 이 비교는 정보 제공 목적으로 제공되며 제휴나 보증을 의미하지 않습니다.
각각의 강점 영역
정답은 워크로드에 따라 다릅니다. 절대적인 지연 하한이 요구되는 경우에는 InfiniBand를, 운영 모델·비용·사이트 간 도달 거리가 결정을 좌우하는 경우에는 RoCE를 선택하십시오.
지연 하한이 사양일 때
총소유비용보다 절대적인 NIC 대 NIC 지연 하한이 더 중요한 긴밀하게 결합된 HPC 시뮬레이션, 그리고 단일 벤더 스택이 허용되는 폐쇄적인 단일 테넌트 클러스터에 해당합니다.
운영과 공급망이 중요할 때
나머지 데이터센터와 하나의 운영 모델, 하나의 도구 스택, 멀티벤더 공급망을 공유하는 멀티테넌트 GPU-as-a-Service 및 AI back-end에 해당합니다.
GPU당 비용이 관건일 때
개방형 하드웨어 spine과 OcNOS-DC는 단일 벤더 네트워크 프리미엄을 제거합니다. 수천 개 규모의 GPU 구축에서 이는 하드웨어 예산의 상당한 비중입니다.
패브릭이 여러 데이터센터에 걸칠 때
이더넷은 별도의 장거리 게이트웨이 계층 없이 400G ZR/ZR+ 코히어런트 광 트랜시버로 홀과 리전 전반에 자연스럽게 확장됩니다.
OcNOS-DC가 RoCEv2 경로를 제공하는 방식
OcNOS-DC는 RoCEv2가 요구하는 무손실 이더넷 기반을 제공합니다. 스위치는 손실 회피 및 혼잡 프리미티브를 공급하고, RoCEv2는 NIC에서 실행되는 트랜스포트입니다. 이는 오늘날 OcNOS-DC에서 검증된 스위치 기능입니다.
PFC and ECN
Priority Flow Control, DCBX/LLDP를 갖춘 Layer 3 상의 PFC-with-QoS를 포함하며, ECN 및 Dynamic ECN을 통해 RDMA 플로우가 드롭 없이 얕은 큐를 유지하도록 합니다.
DCQCN 마킹
스위치가 ECN을 마킹하여 종단 간 NIC과 스위치의 DCQCN 루프 가 송신 측의 전송률을 제한할 수 있습니다. ETS와 WRED가 RDMA를 전달하는 큐를 셰이핑하고 관리합니다.
DLB와 RTAG7
동적 로드 밸런싱 (Reactive Path Rebalance 및 Random Flow 포함)이 RTAG7 해싱과 함께 collective를 분산하고 로컬 혼잡 시 재조정합니다.
PFC 데드락 보호
PFC Deadlock Detection and Recovery 와 버퍼 튜닝이 PFC가 유발할 수 있는 일시 정지 전파 하에서 무손실 패브릭을 안정적으로 유지합니다.
gNMI / OpenConfig
Streaming gNMI 및 OpenConfig 텔레메트리 가 클러스터 브링업 및 정상 상태 운영 중 폐루프 튜닝을 위한 우선순위별 가시성을 제공합니다.
UEC 1.0에 부합
IP Infusion은 Ultra Ethernet Consortium의 기여 회원사이며, OcNOS-DC는 다음에 부합합니다 UEC 1.0 패브릭 프로파일, 따라서 패브릭은 UEC 지원 NIC이 출시됨에 따라 그대로 이어집니다. 부합은 인증 주장이 아닙니다.
실리콘 선택은 개방적입니다. OcNOS-DC는 Broadcom Tomahawk 5의 Edgecore AIS800-64D 및 UfiSpace S9321-64E / S9321-64EO(-64EO는 400G ZR+ 추가)에서, 그리고 Tomahawk 4의 Edgecore AS9736-64D에서 실행되며, 모두 RoCEv2에 맞춰 튜닝된 on-chip 공유 버퍼 플랫폼입니다. 하나의 IP Infusion 계약이 소프트웨어와 검증된 하드웨어를 포괄하며, 하나의 TAC와 하나의 SLA를 제공합니다.
많은 사업자가 AI back-end를 이더넷으로 옮기는 이유
이 전환은 순수한 지연보다 운영적·경제적 이유가 큽니다. 대규모 구축에서는 세 가지가 빠르게 누적됩니다. 나머지 데이터센터와 공유되는 하나의 네트워크 모델, 멀티벤더 공급망, 그리고 400G 및 800G에서의 더 낮은 포트당 비용입니다.
그 규모는 현장에서 입증되었습니다. Meta는 한때 InfiniBand가 필요하다고 여겨졌던 규모인 24,000-GPU 클러스터에서 RoCE 이더넷 패브릭을 통해 자사 최대 규모 모델을 학습했다고 설명했습니다. Tomahawk 4 및 Tomahawk 5의 적응형 로드 밸런싱은 실시간 혼잡에 따라 플로우를 재배치하므로, 잘 운영되는 패브릭은 정적 해싱이라면 유휴 상태로 방치했을 90퍼센트 이상의 활용률을 목표로 할 수 있습니다. 90퍼센트는 측정된 보장치가 아니라 설계 목표입니다.
InfiniBand에 남아 있는 우위인 더 낮은 절대 지연 하한은 일부 긴밀하게 결합된 HPC 워크로드에서 여전히 중요합니다. 대규모의 대부분 분산 학습 및 추론 collective에서는 올바르게 튜닝된 RoCEv2 패브릭이 작업 완료 시간을 바꾸는 임계값 아래에 위치하며, 이것이 이제 운영적·경제적 근거가 대부분의 신규 AI back-end 구축을 결정하는 이유입니다.
- 나머지 데이터센터와 공유되는 하나의 네트워크 모델로, 기술과 도구가 그대로 이어집니다.
- 실리콘, 스위치, NIC, 광 트랜시버를 이중 소싱할 수 있게 하는 멀티벤더 공급망.
- 400G 및 800G에서의 더 낮은 포트당 비용으로, 더 많은 GPU, 더 큰 스토리지 계층, 또는 두 번째 사이트를 위한 자본을 확보합니다.
둘 다 유효하며, 대부분의 신규 AI back-end는 이더넷으로 귀결됩니다
InfiniBand는 일부 긴밀하게 결합된 HPC 워크로드가 계속 비용을 지불할 더 낮은 절대 지연 하한을 유지합니다. 대부분의 AI back-end 구축에서는 운영적·경제적 근거가 개방형 이더넷 위의 RoCEv2 쪽으로 결정을 내립니다.
둘 다 유효합니다
InfiniBand는 일부 긴밀하게 결합된 HPC 워크로드가 계속 비용을 지불할 더 낮은 절대 지연 하한을 유지합니다.
RoCEv2는 AI에서 그 격차를 좁혔습니다
PFC, ECN, DCQCN, 적응형 로드 밸런싱이 올바르게 구성되면, 이더넷은 하드웨어 선택권을 유지하면서 대부분의 분산 학습 collective에서 InfiniBand에 필적합니다.
결정은 대개 운영적입니다
하나의 네트워크 모델, 멀티벤더 공급망, 그리고 400G 및 800G에서의 더 낮은 포트당 비용이 대부분의 신규 AI back-end 구축을 결정합니다.
OcNOS-DC는 개방형 경로입니다
오늘날 검증된 RoCEv2 프리미티브, 미래를 위한 UEC 1.0 부합, Edgecore 및 UfiSpace의 검증된 개방형 하드웨어에서, 하나의 계약, 하나의 TAC, 하나의 SLA로 제공됩니다.
RoCE vs InfiniBand FAQ
RoCE와 InfiniBand의 차이는 무엇입니까?
AI에서 이더넷은 InfiniBand만큼 빠릅니까?
RoCEv2이란 무엇입니까?
RoCE는 무손실 패브릭이 필요합니까?
개방형 스위치에서 RoCE를 실행할 수 있습니까?
Ultra Ethernet은 어떻습니까?
더 깊이 살펴보십시오. 자료를 소장하십시오.
제품 데이터시트와 이 페이지보다 한층 더 깊이 있는 간결한 기술 다운로드 자료입니다.
OcNOS-DC 데이터시트
OcNOS-DC 전체 사양: EVPN-VXLAN 및 Ethernet for AI 기능 세트, 소프트웨어 SKU, 지원 하드웨어 플랫폼, 솔루션 주문 가이드.
Datasheet 받기OcNOS 800G 무손실 AI Fabric
Broadcom Tomahawk 4/5 스파인 기반의 논블로킹 RoCEv2 fabric: SKU 등급, 검증된 플랫폼, 도입 아키텍처를 다룹니다.
브리프 받기EVPN-VXLAN 데이터센터 패브릭
통신사업자급 leaf-spine 데이터센터 패브릭: 대칭 IRB, Type-2/Type-5 경로, 그리고 분산 애니캐스트 게이트웨이.
브리프 받기OcNOS-DC 데이터시트
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
OcNOS 800G 무손실 AI Fabric
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
EVPN-VXLAN 데이터센터 패브릭
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
InfiniBand와 비교하여 RoCEv2 패브릭을 사이징 중이신가요? 워크로드에 특화된 계산을 함께 진행합시다
워크로드와 GPU 규모를 알려주시면 IP Infusion 엔지니어가 함께 수치를 계산해 드리며, AI Fabric Design Suite에서 1차 leaf-spine 레이아웃으로 시작하실 수도 있습니다.
OcNOS로 전체 AI 패브릭을 설계하십시오
비즈니스 사례부터 포트 수 계산까지, 구축 과정의 어느 단계에서든 이어서 진행하십시오.