AI 패브릭을 위한 InfiniBand vs Ethernet

"그냥 InfiniBand를 사면 된다"는 것이 한때 사소하지 않은 모든 GPU 클러스터에 대한 안전한 해답이었지만, 그 해답이 바뀌고 있습니다. 최신 Ethernet(PFC를 사용하는 RoCEv2, ECN/DCQCN, DLB, 그리고 곧 출시될 GLB와 UEC)은 성능 격차의 대부분을 좁히는 동시에, 하이퍼스케일러들이 향하고 있는 멀티 벤더 open-hardware의 문을 엽니다.

InfiniBand or Ethernet for an AI cluster? InfiniBand still leads on raw latency for tightly coupled HPC, but modern Ethernet with RoCEv2 (PFC, ECN, DLB) now runs production AI fabrics at 400G and 800G, keeps your NIC, GPU, and switch choices open, and shares one operating model with the rest of the data center. OcNOS-DC delivers that Ethernet fabric today, and IP Infusion is a contributing member of the Ultra Ethernet Consortium shaping where the standard goes next.

두 패브릭, 두 운영 모델

왼쪽: 단일 IB 실리콘 벤더, 단일 스위치 세트, 단일 NIC 에코시스템으로 구성된 단일 벤더 InfiniBand fabric. 오른쪽: 어떤 벤더의 RoCEv2 / UEC NIC든 사용할 수 있고, Broadcom의 스위치 실리콘과 NOS로서의 OcNOS-DC, 그리고 나머지 DC와 동일한 프로토콜을 사용하는 멀티 벤더 개방형 Ethernet fabric.

InfiniBand 단일 벤더 패브릭 대 멀티 벤더 이더넷 패브릭 나란히 배치된 두 개의 패브릭 토폴로지. 좌측: 두 개의 IB 스위치와 네 개의 GPU로 구성되며 모두 단일 벤더로 표기된 단일 벤더 InfiniBand 패브릭. 우측: OcNOS-DC를 실행하는 두 개의 leaf, 두 개의 spine, 벤더 중립적인 RoCEv2/UEC NIC를 갖춘 네 개의 GPU로 구성된 멀티 벤더 이더넷 패브릭. 하단 레이블은 단일 벤더 종속과 개방형 멀티 벤더 스택을 대비합니다. InfiniBand · 단일 벤더 이더넷 · 개방형 멀티벤더 IB 스위치-1Quantum-class IB 스위치-2Quantum-class GPUIB NIC GPUIB NIC GPUIB NIC 단일 NIC + 스위치 벤더 · 폐쇄형 에코시스템 UFM / SHARP · 서브넷 매니저 · 멀티테넌시 미지원 Spine-1OcNOS-DC · TH5 Spine-2OcNOS-DC · TH5 GPURoCEv2/UEC GPURoCEv2/UEC GPURoCEv2/UEC 멀티벤더 · 개방형 하드웨어 · 표준 프로토콜 RoCEv2 · DLB · GLB · UEC · EVPN-VXLAN · gNMI 단일 벤더 성능 비용 vs 개방형 멀티벤더 경제성

비교

InfiniBand는 저지연 무손실 RDMA를 목적으로 설계되었습니다. 지난 20년간 이는 긴밀하게 결합된 HPC 워크로드에서 실질적인 성능 우위를 제공했습니다. DCB 스택, RoCEv2, 그리고 점차 확대되는 DLB와 UEC를 기반으로 하는 최신 Ethernet은 지난 수년간 그 격차를 좁혀왔습니다. 남아 있는 격차는 일부 워크로드에서는 중요하고 다른 워크로드에서는 그렇지 않습니다. 올바른 답은 신념의 문제가 아니라 워크로드에 따라 달라집니다.

Axis InfiniBand 이더넷 (RoCEv2 / UEC)
최저 지연 시간 매우 낮은 종단 간 NIC-to-NIC 지연; 일반적으로 수백 나노초의 스위치 hop. IB보다 수백 나노초 높은 최저치를 보이지만, 대규모 환경에서 대부분의 분산 학습 collective에 영향을 주는 임계치보다는 충분히 낮습니다.
손실 허용도 아키텍처 차원의 무손실 (credit 기반 흐름 제어). PFC + ECN + DCQCN을 통한 무손실. 오늘날 상용 환경 검증 수준이며, UEC는 PFC pause에 대한 의존도를 더욱 낮춥니다.
멀티패스 / 부하 분산 사양에 기본 내장된 적응형 라우팅. 정적 ECMP에 더해, 적응형 single-hop을 위한 DLB, end-to-end를 위한 GLB(OcNOS 7.1), 차세대를 위한 UEC packet-spray를 제공합니다.
벤더 에코시스템 NIC와 스위치 실리콘 모두 사실상 단일 벤더. 모든 계층에서 멀티 벤더: ASIC, switch, NIC, NOS, 광 장비. UEC는 벤더 중립적 상호 운용성을 명시적으로 목표로 설계되었습니다.
운영 모델 서브넷 매니저(UFM급). DC의 나머지 부분과 다릅니다. 별도의 기술, 별도의 도구가 필요합니다. 이미 운영 중인 동일한 BGP, EVPN, gNMI를 사용합니다. DC의 나머지 영역과 동일한 자동화 도구(Ansible, NETCONF, OpenConfig)를 사용합니다.
Multi-tenancy 제한적. 파티셔닝이 존재하지만 핵심 개념은 아닙니다. EVPN-VXLAN을 통한 일급 지원. GPU-as-a-Service, 멀티팀 클러스터, 공유 인프라 모두 자연스럽게 구현됩니다.
장거리 DCI 이를 위해 설계되지 않음; IB-over-WAN 게이트웨이 필요. 400G ZR/ZR+ 코히어런트 플러거블과 EVPN 인터 DC를 통한 네이티브 지원.
스토리지 통합 스토리지는 컴퓨트와 함께 동작하며 IB 연결 스토리지가 필요합니다. NVMe-oF, NFS, S3를 모두 동일한 이더넷 패브릭에서.
포트당 비용 (일반적인 400G+) 프리미엄; 단일 벤더 가격 정책. 오픈 하드웨어 spine + OcNOS-DC NOS는 벤더 종속형 대안보다 비용을 실질적으로 낮춥니다.
로드맵 추진 속도 단일 벤더의 릴리스 주기에 좌우됩니다. UEC 컨소시엄(AMD, Arista, Broadcom, Cisco, HPE, Intel, Meta, Microsoft, Oracle …)이 공개적으로 발표되는 사양의 발전을 주도합니다.

각각의 강점 영역

InfiniBand를 선택해야 하는 경우

지연 시간 하한이 계약으로 보장됩니다

모든 컬렉티브가 중요하고 총소유비용보다 절대적인 지연 시간 하한이 더 중요한 HPC 시뮬레이션 워크로드를 위한 것입니다. 락인을 감수할 수 있는 긴밀하고 종속적인 단일 테넌트 클러스터에 적합합니다.

Ethernet를 선택해야 할 때

운영 모델이 중요합니다

멀티 테넌트 GPU-as-a-Service입니다. DC의 나머지 인프라와 자원을 공유하는 AI 클러스터입니다. 하나의 운영 모델, 하나의 도구 스택, 멀티벤더 공급망을 원하는 팀이라면 어떤 환경에든 적합합니다.

Ethernet를 선택해야 할 때

GPU flop당 비용이 관건입니다

open-hardware spine과 OcNOS-DC의 조합은 독점 네트워크 비용을 없앱니다. 수천 개 규모의 GPU 클러스터에서 절감된 capex로 추가 GPU 용량을 확보하는 경우가 많습니다.

Ethernet를 선택해야 할 때

패브릭이 여러 DC에 걸쳐 확장됩니다

학습 작업이 두 개의 홀 또는 두 개의 리전에 걸쳐 진행될 가능성이 있다면, 이더넷이 기본적으로 우위를 점합니다. 코히런트 DCI, EVPN inter-DC, 표준 멀티벤더 광학을 통해 이 문제는 분기 단위의 라인 시스템 프로젝트가 아닌 하루 만에 처리할 수 있는 작업이 됩니다.

최신 이더넷이 격차를 좁힌 영역

무손실 동작. PFC, DCQCN을 사용한 RoCEv2, 그리고 OcNOS-DC PFC 데드록 워치독 는 오늘날 상용 환경에서 검증된 수준입니다. "이더넷은 패킷을 드롭한다"는 비판은 이를 올바르게 구성하고 나면 더 이상 유효하지 않습니다.

적응형 라우팅. AI 워크로드에서 정적 ECMP 충돌은 실제로 발생하지만, DLB 로컬 혼잡 발생 시 sub-millisecond 단위로 flowlet을 재배치하며, GLB OcNOS 7.1에서는 이를 완전한 엔드 투 엔드 경로 스코어링으로 확장합니다.

스프레이에 적합한 전송. Ultra Ethernet (UEC) 표준 이더넷에 패킷 스프레이, 멀티패스 RDMA, 비순차 전달, 선택적 재전송을 제공합니다. InfiniBand를 정의했던 아키텍처적 장점이 멀티벤더 개방형 스택으로 도래하고 있습니다.

TCO에 관한 논의

For most production AI fabric decisions in 2026, the network is 5-8% of cluster TCO over five years. The InfiniBand premium typically lands in the +30% to +60% range over open-hardware Ethernet for equivalent capacity. On a $100M cluster, that's a meaningful number, but the more important number is what you can do with the saved capex (more GPUs, larger storage tier, second site for HA). And for clusters where the network is multi-tenant or shared with the rest of DC, the operational simplification of one network model is worth more than its line-item cost difference.

IP Infusion의 관점

  • 둘 다 각자의 역할이 있습니다. Ethernet이 모든 워크로드에서 우위를 차지한다고 주장하지는 않겠습니다. 절대적 최저 지연 요건을 갖춘 긴밀한 HPC 클러스터는 당분간 InfiniBand를 계속 구매할 것입니다.
  • 대부분의 AI 패브릭은 Ethernet에 적합합니다. 하이퍼스케일 규모의 프로덕션 AI 학습 및 추론이 Ethernet으로 이동하고 있습니다. 기술 격차가 좁혀지고 나면 운영 및 경제적 타당성이 압도적이기 때문이며, 그 격차는 빠르게 좁혀지고 있습니다.
  • OcNOS-DC는 개방형 경로입니다. 오늘은 RoCEv2, 오늘은 DLB, 다음은 GLB, 그리고 NIC 출시에 맞춘 UEC. Edgecore, UfiSpace, Wedge 등의 검증된 오픈 하드웨어 위에서 하나의 NOS, 하나의 기능 로드맵.
  • 아키텍처 검토는 무료입니다. fabric를 사이징하면서 벤더의 영업 제안이 아니라 워크로드에 특화된 분석을 원하신다면, 당사의 네트워크 아키텍트가 고객과 함께 계산을 수행합니다. 또는 아래에서 leaf-spine 초기 레이아웃을 출발점으로 삼을 수도 있습니다 AI Fabric 사이징 도구.

다음 클러스터에 IB와 Ethernet 중 무엇을 선택하시겠습니까? 워크로드별 계산을 함께 해보겠습니다.

아키텍처 리뷰 예약하기 →
자주 묻는 질문

자주 묻는 질문

Ethernet 은 InfiniBand 와 비교하여 AI 트레이닝에 충분히 빠릅니까?
대규모 분산 학습의 대다수 집합 연산에 대해서는 그렇습니다. Ethernet은 InfiniBand보다 수백 나노초 높은 지연 하한을 가지지만, PFC, DCQCN, DLB를 갖춘 RoCEv2가 올바르게 구성되면 이는 대부분의 워크로드에 영향을 미치는 임계값을 밑돕니다.
어떤 경우에 여전히 InfiniBand를 선택해야 합니까?
절대적인 지연 하한이 total cost of ownership보다 중요한 긴밀한 HPC 시뮬레이션과, single-vendor lock-in이 허용되는 폐쇄형 단일 테넌트 클러스터에는 InfiniBand를 선택하십시오.
AI fabric에서 Ethernet이 우위를 갖는 경우는 언제입니까?
Ethernet 는 멀티 테넌트 GPU-as-a-Service, data center 의 나머지 부분과 단일 운영 모델 및 도구를 공유하는 클러스터, 비용에 민감한 수천 GPU 규모의 구축, 그리고 coherent DCI 와 EVPN 을 통해 data center 간에 확장되는 fabric 에서 우위를 점합니다.
OcNOS 는 InfiniBand 와의 격차를 어떻게 좁힙니까?
OcNOS-DC는 현재 RoCEv2 lossless 전송, DLB 적응형 라우팅, PFC 데드록 워치독을 제공하며, 종단 간 경로 스코어링을 위한 GLB를 7.1에서, UEC 지원을 NIC 출시에 맞춰 제공합니다. 이 모두는 Edgecore, UfiSpace 등 벤더의 검증된 open hardware에서 동작합니다.
Are hyperscalers replacing InfiniBand with Ethernet for AI?
Yes. Ethernet passed InfiniBand in AI back-end networking during 2025, and industry reporting in early 2026 put roughly 70 percent of new AI fabric deployments on Ethernet. Meta has described training its largest models over a RoCE Ethernet fabric on a 24,000-GPU cluster. The Ultra Ethernet Consortium, whose founding members include AMD, Arista, Broadcom, Cisco, Eviden, HPE, Intel, Meta and Microsoft, was formed to standardize this direction. The reasons are operational and economic: one network model shared with the rest of the data center, a multi-vendor supply chain, and lower cost per port at 400G and 800G.
What is the best alternative to InfiniBand for AI cluster networking?
Ethernet with RoCEv2 is the mainstream alternative. It carries RDMA losslessly using PFC, ECN and DCQCN, adds adaptive routing through DLB, and gains packet spray and multi-path RDMA through Ultra Ethernet as UEC NICs ship. On open hardware running OcNOS-DC, it delivers this on a multi-vendor stack rather than a single-vendor fabric.
What is the difference between Ultra Ethernet and InfiniBand?
Ultra Ethernet (UEC) brings the transport techniques that defined InfiniBand to standard Ethernet: packet spray across all paths, multi-path RDMA, out-of-order delivery, and selective retransmission. The UEC 1.0 specification, published in 2025, defines this transport. The difference is the ecosystem: InfiniBand is effectively single-vendor for NIC and switch silicon, while Ultra Ethernet is an open, multi-vendor specification any vendor can build to.
How much does an Ethernet AI fabric cost compared to InfiniBand?
The network is roughly 5 to 8 percent of AI cluster total cost of ownership over five years, so it is rarely the largest line item. For equivalent capacity, single-vendor InfiniBand generally carries a price premium over open-hardware Ethernet running OcNOS-DC. The more important number is what the saved capital funds, whether that is more GPUs, a larger storage tier, or a second site for resilience.