AI fabric 설계 도구

논블로킹 RoCEv2 GPU fabric 을 엔드투엔드로, 벤더 중립적으로 설계하십시오. leaf 및 spine 스위치를 사이징하고, 트랜시버 및 케이블 수량을 계획하며, 귀하의 클러스터에 대해 InfiniBand 와 Ethernet 을 비교하고, lossless 혼잡 프로파일을 확인할 수 있습니다. 본 도구는 네트워크 설계만을 수행합니다. 비용 견적이나 자재 명세서를 제공하지 않습니다.

Step 1

GPU fabric 규모 산정

시작 규모를 선택하거나 GPU 수, 포트 속도, 스위치 실리콘을 직접 입력하십시오. 이 도구는 folded 2계층 leaf-spine 파드를 사이징하고, 클러스터가 3계층 규모로 넘어가는 시점을 표시합니다.

SPINE Spine 1Spine 2Spine 3 LEAF Leaf 1Leaf 2Leaf 3Leaf 4 GPU SERVERS
leaf 스위치
spine 스위치
총 스위치 수

이 수치는 GPU당 하나의 fabric NIC를 갖춘 접힌 형태의 leaf-spine (Clos) fabric을 전제로 하며, 각 leaf는 자신의 포트를 GPU와 spine 업링크 사이에 분배합니다. rail-optimized 배선(GPU당 여러 개의 NIC)은 트래픽 지역성을 바꾸지만 이러한 스위치 수량은 바꾸지 않습니다. 다음을 참조하십시오: AI fabric 토폴로지 레퍼런스 디자인 rail-optimized 및 3계층 레이아웃에 적합합니다.

Step 2

구성 요소 요약

규모가 산정된 설계에 대한 fabric 링크, 트랜시버, 케이블 수량입니다. 이는 계획용 수치일 뿐이며, 자재 명세서, 견적 또는 가격이 아닙니다.

ComponentBasisQuantity
GPU 측 링크GPUs × 1 NIC
leaf에서 spine으로의 fabric 링크leaves × uplinks
fabric 트랜시버links × 2 ends
패브릭 케이블링크당 1개

도달 거리별 매체는 케이블링에 따라 선택합니다. 최대 3 m 는 DAC 또는 AEC, 최대 50~100 m 는 AOC 또는 SR, 최대 500 m 는 DR(주력), 최대 2 km 는 FR 입니다. 도달 거리 등급만 표시합니다. 가격, SKU, 벤더 부품 번호는 포함하지 않습니다. 3계층 설계에서는 위의 수량에 더해 spine 에서 super-spine 으로의 링크를 추가하십시오.

Decision

InfiniBand 대 Ethernet

여섯 가지 요소를 아우르는 벤더 중립적 스코어카드입니다. 입력값에 따라 각 요소가 어느 쪽으로 기우는지와 그 이유를 보여줍니다. 이 스코어카드에는 의도적으로 단일 승자가 없습니다. 최종 권고가 아니라 설계 검토를 위한 입력 자료로 활용하시기 바랍니다.

FactorInfiniBandEthernet / RoCEv2Ultra Ethernet (trajectory)
최대 성능InfiniBand 성향낮은 튜닝 노력으로 얻는 10퍼센트 중반대의 원시 처리량 우위와 더불어, 집합 연산을 GPU에서 오프로드하는 SHARP in-network 리덕션을 제공합니다.Matches InfiniBand with proper tuning. Meta has described training its largest models on a 24,000-GPU RoCEv2 Ethernet cluster in production. The gap is tuning effort, not the ceiling.packet spray와 NIC 측 재정렬을 추가하여 테일 레이턴시를 줄이고 PFC 의존도를 낮춤으로써 기본 상태에서의 격차를 좁힙니다.
CostEthernet 지향fabric 규모에서는 상당한 프리미엄이 발생하며, 동등한 Ethernet 대비 일반적으로 30~60퍼센트 범위로 언급됩니다.merchant-silicon 스위치와 폭넓은 광학 부품 공급망 덕분에 일반적으로 포트당 비용이 낮은 fabric이 됩니다.Ethernet과 동일한 오픈 merchant silicon의 경제성입니다.
개방성Ethernet 지향스위치, NIC, 매니저까지 엔드투엔드로 단일 벤더 스택이 되므로, 멀티벤더 소싱은 제한됩니다.개방적이고 멀티벤더 방식입니다. 다수의 공급업체가 제공하는 표준 기반 스위치, NIC, NOS를 통해 공급망 선택의 유연성을 확보합니다.개방형 방향성을 강화하는 산업 컨소시엄 표준(UEC 1.0, 2025년).
운영의 단순성neutralUFM는 단일의 전용 fabric 관리자를 제공하며, RDMA에 정통한 인력이 없는 팀에게 턴키 솔루션이 됩니다.풍부한 Ethernet 인력 풀과 표준 도구를 활용하지만, lossless RoCEv2에는 종단 간의 세심한 튜닝이 필요합니다.튜닝 부담을 줄여 Ethernet을 IB와 유사한 별도 설정 없는 동작에 가깝게 만드는 것을 목표로 합니다.
멀티테넌시와 컨버전스Ethernet 지향일반적으로 전용 백엔드 아일랜드로, 네이티브 멀티테넌트 격리나 스토리지 컨버전스를 갖추고 있지 않습니다.하나의 통합 Ethernet fabric 으로 표준적인 테넌트 격리를 적용하면서 백엔드, 스토리지, 프런트엔드 트래픽을 전송할 수 있습니다.단일 개방형 fabric에서 converged-Ethernet 방향성을 확장합니다.
TrajectoryEthernet 지향성숙하고 안정적이며 낮은 튜닝으로도 우수한 성능을 제공하지만, 단일 벤더의 로드맵에 의존합니다.Ethernet은 2025년 중반까지 AI back-end 배포를 주도하는 위치로 전환되었으며, 폭넓은 에코시스템의 추진력을 확보하였습니다.UEC 1.0 (2025)은 AI 및 HPC back-end fabric을 명시적으로 대상으로 하는 멀티벤더 사양입니다.

전제: 성능은 튜닝을 전제로 비교합니다(튜닝하지 않은 Ethernet은 뒤처지고, 충분히 튜닝한 Ethernet은 동등 수준에 도달합니다). 비용은 범위로 제시하며 금액으로 제시하지 않습니다. 개방성은 멀티벤더 조달을 의미하며 품질에 대한 판단이 아닙니다. Ultra Ethernet은 2025년 이후의 방향성을 나타내며 출하된 제품이 아닙니다. 집합 연산 튜닝은 xCCL 라이브러리를 총칭적으로 지칭합니다. 본 내용은 의사결정을 위한 참고 정보이며, fabric 선택은 IP Infusion 엔지니어와 함께 검증하십시오.

프로필

RoCEv2 lossless 프로파일

RoCEv2는 단일 스위치 기능이 아닙니다. 이는 PFC, ECN, ETS로 구성된 프로파일로, DCQCN이 정상 상태의 작업을 수행하고 PFC가 최후의 방어선 역할을 합니다. 본 도구는 귀하의 설계에 적용할 메커니즘과 그 적용 순서를 권장합니다. 임계값을 출력하지 않으며, 어떠한 장비에도 변경을 가하지 않습니다.

Mechanismlossless 프로파일에서의 역할OcNOS 가용성
PFCRoCE 클래스에 대한 무손실 보장입니다. 최후의 방어선일 뿐, 주된 제어 수단은 아닙니다.4 개의 AI 플랫폼 전체
ECN혼잡을 조기에 마킹하여 큐가 넘치기 전에 송신측이 전송률을 낮추도록 합니다. 마킹 지점은 PFC 트리거보다 낮게 조정하십시오.4 개의 AI 플랫폼 전체
DCQCN (ECN + PFC)정상 상태의 주된 제어입니다. ECN 마킹이 NIC 에서의 DCQCN 반응을 구동하며 PFC 가 이를 뒷받침합니다. 독립적인 기능이 아니라 복합적으로 구성된 것입니다.4 개의 AI 플랫폼 전체
ETS대역폭 보장과 클래스 격리를 통해 lossless 클래스가 best-effort 트래픽에 의해 자원을 잠식당하지 않도록 합니다.4 개의 AI 플랫폼 전체
PFC 데드락 워치독PFC pause 데드락 또는 스톰 상태를 감지하고 해소하는, PFC 백스톱을 위한 안전망입니다.4 개 전체, OcNOS 7.0
DLB (동적 로드 밸런싱)Spreads elephant RoCE flows that collide under static ECMP, targeting utilization above 90 percent on the same switches.4 개의 AI 플랫폼 전체
동적 ECNECN 마킹을 실시간 큐 상태에 맞게 조정하여 부하 변동에 따른 수동 재조정을 줄입니다.TH5 전용, OcNOS 7.0
DLB 반응형 / 랜덤더 촘촘한 플로우 분산을 위한 고급 DLB 배치 모드입니다. TH4에서는 표준 DLB를 사용하십시오.TH5 전용, OcNOS 7.0
GLB (Global Load Balancing)로컬 DLB 결정을 넘어서는 fabric 전반의 부하 분산.로드맵, OcNOS 7.1 트레인
Ultra EthernetNIC 측 재정렬과 PFC 의존도 감소를 동반한 packet spray 로, lossless AI Ethernet 을 향한 방향성입니다.로드맵, UEC 프로파일

참고용입니다. 이 권고 사항은 어떤 장치에도 적용되지 않으며 여기서 임계값이 생성되지 않습니다. 제공 여부는 OcNOS-DC 에 따릅니다. 기능 매트릭스 and 하드웨어 호환성 목록. 배포 전에 선택한 플랫폼 및 OcNOS 릴리스에 대해 검증하십시오.

Estimate

fabric 전력

사이징된 설계에서 fabric 스위치의 일반적인 전력 범위입니다. 범위 값만이며, 광모듈이 장착된 기준입니다. 네트워크 스위치는 전체 클러스터 전력의 작은 부분에 불과하며, GPU가 대부분을 차지합니다.

kW 일반 하한값
kW(고부하 시)

냉각: 리어 도어 냉각 또는 직접 액체 냉각은 일반적으로 랙당 약 30~40 kW를 초과하는 경우에 검토되며, 이는 네트워크가 아니라 GPU 서버 밀도에 따른 것입니다. 이는 지침이며 산출된 열 부하가 아닙니다. 스위치 전력 범위는 옵틱이 장착된 51.2T (Tomahawk 5) 및 25.6T (Tomahawk 4) 클래스 장비의 대표값입니다. 정확한 수치는 각 플랫폼 데이터시트에서 확인하시기 바랍니다.

해당 OcNOS-DC 플랫폼

fabric 은 오픈 Broadcom Tomahawk 하드웨어에서 단일 OcNOS-DC 이미지를 실행합니다. 다음은 설계 대상이 되는 지원 800G 및 400G 플랫폼입니다.

본 도구는 계획 수립만을 목적으로 하는 구조적 네트워크 설계 추정치를 제공합니다. 이는 성능 보증, 자재 명세서(BOM), 비용 추정이 아닙니다. 실제 설계는 레일 최적화, GPU당 NIC 수, 케이블링, 장애 도메인 선택에 따라 달라집니다. GPU 수는 Clos radix 계산에서 도출된 레퍼런스 설계상의 상한값이며, 측정값이 아닙니다. Broadcom과 Tomahawk는 Broadcom Inc.의 상표입니다. 그 밖의 명칭은 각 소유자의 상표입니다.

리소스

AI Fabric 레퍼런스 디자인

레퍼런스 디자인 PDF 를 받아보십시오. 토폴로지, 스위치 수, 구성 요소 요약, RoCEv2 lossless 시작 프로파일이 포함됩니다.

PDF 다운로드
자주 묻는 질문

자주 묻는 질문

GPU 클러스터를 위한 leaf-spine fabric은 어떻게 사이징합니까?
논블로킹 2계층 leaf-spine 패브릭에서는 각 leaf 스위치가 포트의 절반을 GPU에, 나머지 절반을 spine 업링크에 할당합니다. leaf 스위치 수는 GPU 수를 leaf당 GPU 대향 포트 수로 나눈 값이며, spine 스위치 수는 오버서브스크립션 없이 모든 leaf 업링크를 수용하는 데 필요한 최소 수입니다. 단일 leaf 클러스터에는 spine 계층이 필요하지 않습니다. 이 도구는 400G 또는 800G의 Broadcom Tomahawk 4 및 Tomahawk 5에 대해 이러한 수치를 계산합니다.
rail-optimized 토폴로지란 무엇입니까?
rail-optimized 란 각 GPU 서버가 여러 개의 NIC(일반적으로 레일당 하나씩 총 8개)를 갖추고, 각 레일이 자체 leaf 에 연결되는 것을 의미합니다. 이에 따라 서버 간 동일 인덱스의 GPU 가 같은 leaf 에 수용되며, 지배적인 AllReduce 트래픽이 로컬에 머무릅니다. 이는 1:1 논블로킹 fabric 위에 얹은 배선 및 트래픽 지역성 원칙입니다. 트래픽이 흐르는 위치를 바꿀 뿐, leaf 및 spine 스위치 수를 바꾸는 것은 아닙니다.
AI fabric에는 몇 개의 트랜시버가 필요합니까?
모든 point-to-point fabric 링크는 양끝에 하나씩 총 2개의 트랜시버를 사용하므로, 트랜시버 수는 leaf-to-spine 링크 수의 2배입니다. 링크 수는 leaf 대수에 해당 uplink 수를 곱한 값과 같으며, 이는 spine 대수에 해당 downlink 수를 곱한 값과도 일치합니다. 이 도구는 이러한 수량을 산출합니다. 이는 계획용 수치일 뿐이며, 자재 명세서나 견적이 아닙니다.
AI 에는 RoCEv2 와 InfiniBand 중 무엇이 더 적합합니까?
어느 한쪽이 언제나 우수한 것은 아닙니다. InfiniBand 는 적은 튜닝 노력으로 높은 순수 성능을 제공하며 단일 fabric 관리자를 제공합니다. RoCEv2 를 적용한 Ethernet 은 튜닝을 마치면 동등한 성능에 도달하며, 비용, 개방성, 멀티테넌시, 업계 흐름 측면에서 일반적으로 우위를 보입니다. 적합한 fabric 은 클러스터 규모, 인력 구성, 기존 스택에 따라 결정됩니다. 본 도구는 입력하신 조건에 따라 각 요소를 평가한 뒤, 최종 결정을 설계 검토에 넘깁니다.
RoCEv2를 위해 AI fabric을 lossless로 만들려면 어떻게 해야 합니까?
lossless RoCEv2 는 함께 작동하는 세 가지 메커니즘으로 구성됩니다. no-drop 클래스를 위한 PFC, 조기 혼잡 신호를 위한 ECN, 클래스 격리를 위한 ETS 입니다. ECN 과 PFC 를 결합한 DCQCN 이 정상 상태의 주된 제어이며, PFC 는 최후의 안전장치이므로 ECN 마킹 임계값을 PFC 임계값보다 낮게 조정하십시오. PFC, ECN, CoS 는 종단 간에 일관되게 유지하십시오. OcNOS-DC 는 Tomahawk AI 플랫폼에서 이들을 지원합니다.
동일한 OcNOS 이미지가 fabric 내 모든 스위치에서 동작합니까?
예. 모든 leaf 및 spine 스위치는 RoCEv2, PFC 와 ECN, 동적 로드 밸런싱을 갖춘 단일 OcNOS-DC 이미지를 개방형 Tomahawk 하드웨어에서 실행합니다. 이를 통해 설계에서 산출되는 스위치 수와 관계없이 fabric 을 하나의 운영체제와 하나의 지원 계약으로 유지합니다.
AI 패브릭

OcNOS로 전체 AI 패브릭을 설계하십시오

비즈니스 사례부터 포트 수 계산까지, 구축 과정의 어느 단계에서든 이어서 진행하십시오.