AI 패브릭을 위한 InfiniBand vs Ethernet
대부분의 AI 패브릭에는 이더넷을, 지연에 민감한 HPC에는 InfiniBand를 선택하십시오. RoCEv2를 갖춘 최신 이더넷은 이제 개방형 멀티벤더 하드웨어에서 400G 및 800G로 프로덕션 패브릭을 운영하며, OcNOS-DC가 이를 오늘날 제공합니다. 이 가이드는 각 방식이 여전히 어디에 적합한지를 다룹니다.
동일한 GPU, 매우 다른 두 네트워크
왼쪽은 단일 벤더 InfiniBand 패브릭입니다. 하나의 실리콘 벤더, 하나의 스위치 제품군, 하나의 NIC 생태계, 그리고 나머지 데이터센터와 분리된 서브넷 매니저로 구성됩니다. 오른쪽은 멀티벤더 개방형 이더넷 패브릭입니다. 모든 벤더의 RoCEv2 또는 UEC NIC, Broadcom 스위치 실리콘, NOS로서의 OcNOS-DC, 그리고 이미 운영 중인 동일한 프로토콜을 사용합니다.
InfiniBand와 이더넷, 항목별 비교
InfiniBand는 저지연 무손실 RDMA를 위해 전용으로 설계되었으며, 20년 동안 긴밀하게 결합된 HPC에서 실질적인 우위를 제공했습니다. DCB 스택, RoCEv2, 그리고 점차 DLB와 UEC를 기반으로 하는 최신 이더넷은 지난 수년간 그 격차를 좁혀 왔습니다. 어떤 격차가 여전히 중요한지는 워크로드에 따라 다릅니다.
| Axis | InfiniBandsingle-vendor | EthernetRoCEv2 / UEC, 개방형 |
|---|---|---|
| 최저 지연 시간 | 매우 낮은 종단 간 NIC-to-NIC 지연; 일반적으로 수백 나노초의 스위치 hop. | IB보다 수백 나노초 높은 최저치를 보이지만, 대규모 환경에서 대부분의 분산 학습 collective에 영향을 주는 임계치보다는 충분히 낮습니다. |
| 손실 허용도 | 아키텍처 차원의 무손실 (credit 기반 흐름 제어). | PFC + ECN + DCQCN을 통한 무손실. 오늘날 상용 환경 검증 수준이며, UEC는 PFC pause에 대한 의존도를 더욱 낮춥니다. |
| 멀티패스 / 부하 분산 | 사양에 기본 내장된 적응형 라우팅. | 정적 ECMP에 더해, 적응형 single-hop을 위한 DLB, end-to-end를 위한 GLB(OcNOS 7.1), 차세대를 위한 UEC packet-spray를 제공합니다. |
| 벤더 에코시스템 | NIC와 스위치 실리콘 모두 사실상 단일 벤더. | 모든 계층에서 멀티 벤더: ASIC, switch, NIC, NOS, 광 장비. UEC는 벤더 중립적 상호 운용성을 명시적으로 목표로 설계되었습니다. |
| 운영 모델 | 서브넷 매니저(UFM급). DC의 나머지 부분과 다릅니다. 별도의 기술, 별도의 도구가 필요합니다. | 이미 운영 중인 동일한 BGP, EVPN, gNMI를 사용합니다. DC의 나머지 영역과 동일한 자동화 도구(Ansible, NETCONF, OpenConfig)를 사용합니다. |
| Multi-tenancy | 제한적. 파티셔닝이 존재하지만 핵심 개념은 아닙니다. | EVPN-VXLAN을 통한 일급 지원. GPU-as-a-Service, 멀티팀 클러스터, 공유 인프라 모두 자연스럽게 구현됩니다. |
| 장거리 DCI | 이를 위해 설계되지 않음; IB-over-WAN 게이트웨이 필요. | 400G ZR/ZR+ 코히어런트 플러거블과 EVPN 인터 DC를 통한 네이티브 지원. |
| 스토리지 통합 | 스토리지는 컴퓨트와 함께 동작하며 IB 연결 스토리지가 필요합니다. | NVMe-oF, NFS, S3를 모두 동일한 이더넷 패브릭에서. |
| 포트당 비용 (일반적인 400G+) | 프리미엄; 단일 벤더 가격 정책. | 오픈 하드웨어 spine + OcNOS-DC NOS는 벤더 종속형 대안보다 비용을 실질적으로 낮춥니다. |
| 로드맵 추진 속도 | 단일 벤더의 릴리스 주기에 좌우됩니다. | UEC 컨소시엄(AMD, Arista, Broadcom, Cisco, HPE, Intel, Meta, Microsoft, Oracle)이 공개적으로 게시되는 사양의 발전을 주도합니다. |
각각의 강점 영역
정답은 워크로드에 따라 다릅니다. 절대적인 지연 하한이 요구되는 경우에는 InfiniBand를, 운영 모델·비용·사이트 간 도달 거리가 결정을 좌우하는 경우에는 이더넷을 선택하십시오.
지연 하한이 계약 조건일 때
총소유비용보다 절대적인 지연 하한이 더 중요한 HPC 시뮬레이션, 그리고 종속이 허용되는 긴밀하고 폐쇄적인 단일 테넌트 클러스터에 해당합니다.
운영 모델이 중요할 때
멀티테넌트 GPU-as-a-Service, 그리고 나머지 데이터센터와 인프라를 공유하는 클러스터로, 하나의 운영 모델, 하나의 도구 스택, 멀티벤더 공급망이 유리한 경우입니다.
GPU-flop당 비용이 관건일 때
OcNOS-DC를 갖춘 개방형 하드웨어 스파인은 단일 벤더 네트워크 프리미엄을 제거합니다. 수천 개 규모의 GPU 클러스터에서 이는 하드웨어 예산의 상당한 비중을 차지합니다.
패브릭이 여러 데이터센터에 걸칠 때
학습 작업이 두 개의 홀 또는 두 개의 리전에 걸치게 된다면, 코히어런트 DCI, EVPN inter-DC, 그리고 표준 멀티벤더 광 트랜시버가 이를 한 분기짜리 회선 시스템 프로젝트가 아니라 하루면 해결되는 문제로 만듭니다.
최신 이더넷이 더한 것
세 가지 발전이 프로덕션 AI 패브릭을 이더넷으로 옮겨 놓았습니다. 진정한 무손실 동작, 혼잡한 업링크에서 플로우를 회피시키는 적응형 라우팅, 그리고 스프레이에 친화적인 차세대 트랜스포트입니다.
무손실 동작
RoCEv2 with PFC, DCQCN, 그리고 PFC 데드락 워치독 AI collectives에 필요한 무손실 RDMA 트랜스포트를, 오늘날 표준 이더넷에서 프로덕션 수준으로 제공합니다.
적응형 라우팅
AI 워크로드에서 정적 ECMP 충돌은 실제로 발생하지만, DLB 서브 밀리초 단위의 윈도우에서 로컬 혼잡에 따라 플로우렛을 재배치하며, OcNOS 7.1의 GLB는 이를 종단 간 경로 스코어링으로 확장합니다.
스프레이 친화적 트랜스포트
Ultra Ethernet(UEC 1.0, 2025년 6월)은 다음을 제공합니다 packet spray, 멀티패스 RDMA, 그리고 비순차 전달 을 표준 이더넷으로 가져옵니다. 지금 RoCEv2 위에 구축하고 NIC이 출시됨에 따라 UEC로 가는 깔끔한 경로를 유지하십시오.
네트워크는 작은 비용 항목이므로, 비교의 초점은 그것이 무엇을 확보해 주는지에 두어야 합니다
5년에 걸쳐 스위칭 계층은 클러스터 TCO의 한 자릿수 비율이며, NIC·광 트랜시버·케이블링을 포함하면 그 비율은 올라갑니다. 유용한 질문은 비용 항목 자체가 아니라, 절감된 자본이 무엇에 쓰이는가입니다.
- 동등한 용량 기준으로, 단일 벤더 InfiniBand는 개방형 하드웨어 이더넷보다 가격 프리미엄을 수반합니다.
- 절감된 자본은 더 많은 GPU, 더 큰 스토리지 계층, 또는 복원력을 위한 두 번째 사이트에 투입됩니다.
- 패브릭이 멀티테넌트이거나 나머지 데이터센터와 공유되는 경우, 하나의 네트워크 모델은 비용 항목 차이 이상의 가치를 가집니다.
둘 다 각자의 자리가 있으며, 대부분의 AI 패브릭은 이더넷에 속합니다
이더넷이 모든 워크로드에서 우세한 것은 아니지만, 운영적·경제적 근거는 대부분의 경우 결정적이며, 기술 격차가 좁혀질수록 더욱 강화됩니다.
둘 다 각자의 자리가 있습니다
이더넷이 모든 워크로드에서 우세한 것은 아닙니다. 절대적 하한 지연이 요구되는 긴밀한 HPC 클러스터는 여전히 InfiniBand가 유리합니다.
대부분의 AI 패브릭은 이더넷에 속합니다
하이퍼스케일의 프로덕션 AI 학습 및 추론은 운영적·경제적 근거가 커지고 기술 격차가 계속 좁혀짐에 따라 이더넷으로 이동하고 있습니다.
OcNOS-DC는 개방형 경로입니다
오늘은 RoCEv2, 오늘은 DLB, 다음은 GLB, 그리고 NIC 출시에 맞춘 UEC. Edgecore, UfiSpace 등의 검증된 오픈 하드웨어 위에서 하나의 NOS, 하나의 기능 로드맵.
InfiniBand vs 이더넷, 자주 묻는 질문
Ethernet 은 InfiniBand 와 비교하여 AI 트레이닝에 충분히 빠릅니까?
어떤 경우에 여전히 InfiniBand를 선택해야 합니까?
AI fabric에서 Ethernet이 우위를 갖는 경우는 언제입니까?
OcNOS 는 InfiniBand 와의 격차를 어떻게 좁힙니까?
하이퍼스케일러는 AI를 위해 InfiniBand를 이더넷으로 교체하고 있습니까?
AI 클러스터 네트워킹에서 InfiniBand의 최선의 대안은 무엇입니까?
Ultra Ethernet과 InfiniBand의 차이는 무엇입니까?
이더넷 AI 패브릭은 InfiniBand에 비해 비용이 얼마나 듭니까?
더 깊이 살펴보십시오. 자료를 소장하십시오.
제품 데이터시트와 이 페이지보다 한층 더 깊이 있는 간결한 기술 다운로드 자료입니다.
OcNOS-DC 데이터시트
OcNOS-DC 전체 사양: EVPN-VXLAN 및 Ethernet for AI 기능 세트, 소프트웨어 SKU, 지원 하드웨어 플랫폼, 솔루션 주문 가이드.
Datasheet 받기OcNOS 800G 무손실 AI Fabric
Broadcom Tomahawk 4/5 스파인 기반의 논블로킹 RoCEv2 fabric: SKU 등급, 검증된 플랫폼, 도입 아키텍처를 다룹니다.
브리프 받기EVPN-VXLAN 데이터센터 패브릭
통신사업자급 leaf-spine 데이터센터 패브릭: 대칭 IRB, Type-2/Type-5 경로, 그리고 분산 애니캐스트 게이트웨이.
브리프 받기OcNOS-DC 데이터시트
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
OcNOS 800G 무손실 AI Fabric
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
EVPN-VXLAN 데이터센터 패브릭
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
다음 클러스터를 사이징 중이신가요? 워크로드에 특화된 검토를 받아보십시오
워크로드와 GPU 규모를 알려주시면 IP Infusion 엔지니어가 함께 계산해 드리며, AI Fabric Design Suite에서 1차 leaf-spine 레이아웃으로 시작하실 수도 있습니다.
OcNOS로 전체 AI 패브릭을 설계하십시오
비즈니스 사례부터 포트 수 계산까지, 구축 과정의 어느 단계에서든 이어서 진행하십시오.