Rail-optimized · 3단계 Clos · 코히어런트 DCI

AI Fabric 토폴로지: Rail-Optimized 및 Scheduled 설계

토폴로지를 GPU 수에 맞추십시오. 약 1,000개 GPU까지는 rail-optimized leaf-spine 파드, 16,000개 이상은 3단계 Clos, 그리고 사이트 간 확장에는 코히어런트 DCI입니다. collective 동안 모든 GPU의 링크를 포화 상태로 유지하는, 가장 작은 논블로킹 설계를 선택하십시오. 세 가지 모두 무손실 RoCEv2(PFC + ECN) L3 패브릭 위에서 OcNOS-DC로 실행되며, 여기서는 Broadcom Tomahawk 4 및 Tomahawk 5에서 구체적인 포트 수로 사이징되었습니다.

256 to 16k+GPU, 하나의 설계 체계
1:1논블로킹 GPU 플레인
최대 800GTH5 leaf 및 spine
1 imageOcNOS-DC, 모든 계층
유행어가 아닌 GPU 수로 선택하세요

GPU 수에 맞는 가장 작은 논블로킹 설계

AI 패브릭 토폴로지의 임무는 하나입니다. collective 동안 테일 레이턴시 이상치를 만들지 않으면서 모든 GPU의 아웃바운드 링크를 포화 상태로 유지하는 것입니다. 올바른 토폴로지는 여러분의 GPU 수에 대해 이를 달성하는 가장 작은 것이며, 다음 규모로 넘어갈 때를 위한 대비 경로를 갖춥니다. Broadcom Tomahawk 실리콘에 대한 구체적인 포트 계산과 함께 네 가지 참조 지점을 제시합니다.

하나의 이미지로 모든 확장 단계에
256 GPUs
엔트리 논블로킹 파드
소규모 스파인 계층 위에 레일 정렬형 리프를 배치한 랙 1열. 2계층 폴디드(folded) Clos, 1:1 논블로킹.
8 leaves · 4 spines · TH4 · 400G
1,024 GPUs
Rail 최적화 2계층 파드
1:1 논블로킹 spine을 갖춘 rail 정렬 leaf 구조. rail 내부 AllReduce는 leaf에 머물고, rail 간 트래픽은 spine을 거칩니다. 표준 단일 파드 확장 단위입니다.
32 leaves · 16 spines · TH5 · 800G
4,096 GPUs
3단 Clos
Leaf, spine, super-spine. 각 1,024-GPU 파드는 1:1 논블로킹이며, super-spine 플레인이 파드 전반으로 확장됩니다. 모든 계층에 DLB, OcNOS 7.1 트레인에서 종단 간 GLB.
128 leaves · 64 spines · 32 super-spines · TH5 · 800G
16,384 GPUs
확장형 3단 Clos
슈퍼스파인 플레인을 갖춘 멀티 파드 3단계 Clos. 조 단위 파라미터 학습 클래스에 맞게 설계되었습니다.
512 leaves · 256 spines · 128 super-spines · TH5 · 800G

2계층 leaf-spine의 상한은 GPU당 하나의 800G 패브릭 포트 기준으로 약 2,048개 GPU이며, 그 이상은 super-spine 계층을 추가합니다. 동일한 OcNOS-DC 이미지가 모든 계층에서 실행되므로, 패브릭은 각 단계마다 재설계되는 대신 클러스터와 함께 scale-out됩니다.

직접 클러스터를 사이징하고 계십니까? The AI Fabric Design Suite 빠른 1차 산정을 제공합니다. GPU당 하나의 패브릭 NIC을 가정하여 논블로킹 2계층 leaf-spine 파드를 사이징하고, 3계층 규모로 넘어가는 시점을 표시합니다. 아래의 참조 설계는 동일한 논블로킹 leaf/spine 계산을 사용하고 이를 대규모에서 3단계 Clos로 확장하므로, 스위치 수가 도구와 일치합니다. 여기서 rail-optimized는 8-NIC GPU 서버의 배선 규율(leaf당 하나의 rail이므로 rail 내부 AllReduce는 leaf에 머무름)을 그 논블로킹 패브릭 위에 얹은 것입니다. 이는 스위치 수가 아니라 트래픽 지역성을 바꿉니다. 대략적인 산정에는 도구를, 실제 구축에는 이 설계를 사용하십시오.

세 가지 참조 설계

Rail-optimized, 스케줄드 Clos, 그리고 코히어런트 DCI

OcNOS-DC는 단일 파드, 다중 파드, 다중 사이트 AI 패브릭을 아우르는 세 가지 참조 토폴로지에 맞춰 제공됩니다. 각각은 화이트보드 스케치가 아니라 HCL 등재 Broadcom 하드웨어에서 사이징된 구체적인 구축입니다.

참조 설계 1

Rail-optimized 단일 파드

각 GPU 서버의 8개 NIC이 8개의 전용 rail leaf에 연결됩니다, 따라서 동일 rail의 AllReduce는 하나의 leaf에 머물며 spine을 전혀 거치지 않습니다. 논블로킹 spine이 rail 간 플로우를 전달합니다. 약 1,000개 GPU까지의 단일 파드 확장 단위입니다.

참조 설계 2

스케줄드 3단계 Clos

Leaf, spine, 그리고 super-spine 계층이 4,096개에서 16,384개 GPU까지 확장됩니다. 각 파드 내에서 논블로킹이며, super-spine 플레인이 파드 간 비율을 설정합니다. 모든 홉에 DLB, OcNOS 7.1 트레인에서 종단 간 GLB.

참조 설계 3

코히어런트 다중 DC DCI

학습 작업이 여러 데이터 홀에 걸칠 때, 다음으로 패브릭을 확장하십시오 400G ZR / ZR+ 코히어런트 광 트랜시버 를 spine에 적용합니다. 사이트 간 트랜스폰더 없는 DCI이며, 사이트 내 3단계 Clos는 그대로 유지됩니다.

참조 설계 1

Rail-optimized 단일 파드

각 GPU 서버에는 8개 NIC이 있으며, 각 rail당 하나입니다(각 rail은 전용 xCCL(NCCL / RCCL / oneCCL) collective 채널). 각 rail은 자체 전용 leaf이므로, 모든 서버의 8개 NIC이 서로 다른 leaf에 연결됩니다. rail-N에 걸친 AllReduce는 leaf-N 내부에 머물기 때문에, 지배적인 collective 패턴에 대해 spine에 동서 방향 부하가 발생하지 않습니다.

Rail-optimized AI fabric topology: four 800G Tomahawk 5 spines above eight rail leaves, with four GPU servers each mapping one of its eight NICs to a different rail leaf, so intra-rail AllReduce stays on one leaf.
Rail-optimized single pod: each GPU server's 8 NICs map one per rail to 8 dedicated leaves, so same-rail AllReduce stays on the leaf and only cross-rail traffic reaches the spine.

OcNOS 구성 요소: BGP-unnumbered L3 언더레이, 모든 leaf에서 RoCEv2 무손실(PFC + ECN), spine 계층에서 DLB. HCL 등재 하드웨어 기반 구축: 800G 확장 단위는 TH5 64x800G leaf 및 spine(Edgecore AIS800-64D 또는 UfiSpace S9321-64E)을 사용하고, 엔트리 256-GPU 파드는 Edgecore AS9736-64D(TH4, 64x400G)를 사용합니다.

참조 설계 2

3단계 Clos 스케줄드 패브릭: 4,096개에서 16,384개 GPU

Rail-optimized는 1k에서 2k GPU 사이 어딘가에서 확장이 멈춥니다. leaf radix가 소진되거나 spine 계층이 지나치게 오버서브스크립션됩니다. 그 이상에서는 대부분의 최신 AI 패브릭이 3단계 Clos, 즉 leaf, spine, super-spine으로 이동합니다. 임의의 두 GPU는 최대 네 개의 스위치 홉만큼 떨어져 있으며, 같은 leaf 및 같은 파드의 피어는 더 가깝습니다.

Clos에서 어려운 부분은 어떤 링크도 핫스팟이 되지 않도록 플로우를 고르게 분산하는 것입니다. 방식은 플로우별 ECMP에서 적응형(동적) 로드 밸런싱을 거쳐 패킷별 spray까지 다양하며, 후자는 Ultra Ethernet이 재정렬을 NIC에서 처리하며 사용하는 모델입니다. 별도 계열로, Broadcom DDC와 같은 셀 기반 스케줄드 패브릭은 트래픽을 셀로 분할하여 패브릭 내부에서 스케줄링합니다. OcNOS는 오늘날 DLB로 GPU 플레인의 균형을 유지하고 7.1 트레인에서 패브릭 전체 GLB를 추가하며, UEC NIC이 도입됨에 따라 UEC 지원 준비를 갖춥니다.

이 다이어그램은 개념도로, 계층 수를 축소하여 그렸습니다. 4,096-GPU 구축은 TH5 800G에서 128 leaf / 64 spine / 32 super-spine입니다.

Three-stage Clos AI fabric topology: a super-spine tier over a spine tier over leaf switches feeding GPU pods, sized to 4,096 GPUs on 800G Tomahawk 5 with DLB at every hop.
스케줄드 3단계 Clos: leaf, spine, super-spine 계층이 논블로킹 GPU 플레인을 수천 개 GPU로 확장하며, 모든 홉에 DLB와 OcNOS 7.1 트레인의 패브릭 전체 GLB를 갖춥니다.

OcNOS 구성 요소: eBGP-unnumbered L3 언더레이, RoCEv2 무손실(PFC + ECN), 모든 계층에서 DLB, OcNOS 7.1 트레인에서 종단 간 GLB, 그리고 관측성 스택으로의 gNMI 스트리밍 텔레메트리. 전체가 HCL 등재 TH5 64x800G 섀시로 구축됩니다.

오버서브스크립션은 고정된 규칙이 아니라 조절 가능한 다이얼입니다. 이 수치는 각 1,024-GPU 파드를 1:1 논블로킹으로 만들고, 파드 간 트래픽에는 비용 최적화된 약 2:1 super-spine을 사용합니다. 이는 하이퍼스케일 이더넷 패브릭이 의존하는 rail-optimized 접근 방식입니다(공개된 대규모 설계는 collective 트래픽이 파드 로컬에 머물기 때문에 최상위 계층을 훨씬 더 오버서브스크립션합니다). 대신 최대한의 any-to-any 여유를 원하시나요? 완전한 논블로킹 1:1 구축은 4,096개 GPU에서 128 / 128 / 64이고 16,384개에서 512 / 512 / 256이며, spine과 super-spine 수만 바뀝니다. 다음에서 어느 쪽이든 모델링하십시오 AI Fabric Design Suite.

참조 설계 3

다중 DC AI 패브릭: 코히어런트 DCI

단일 학습 작업이 두 개 이상의 데이터 홀에 걸칠 때(조 단위 파라미터 모델에서 점점 흔해지고 있음), 패브릭은 WAN을 넘어 확장됩니다. OcNOS-DC는 사이트 간 트랜스폰더 없는 DCI를 위해 spine에 직접 400G ZR / ZR+ 코히어런트 광 트랜시버를 지원합니다. 각 사이트의 기반 3단계 Clos는 그대로 유지됩니다.

Multi-data-center AI fabric topology: two leaf-spine sites joined by 400G ZR and ZR+ coherent optics on the spine, extending the fabric across the WAN, no external transponders.
코히어런트 다중 DC DCI: spine의 400G ZR 및 ZR+ 광 트랜시버로 연결된 두 AI 데이터센터가, 외부 트랜스폰더 없이 사이트 간 패브릭을 확장합니다.

OcNOS 구성 요소: DWDM 지원 spine 또는 border-leaf 포트의 400G ZR/ZR+ 플러거블 코히어런트 광 트랜시버로, 사이트 간 gNMI 텔레메트리를 갖춥니다. 외부 트랜스폰더가 필요하지 않습니다. 도달 거리: 400ZR은 증폭 시 약 120 km, OpenZR+는 oFEC로 더 멀리 도달합니다.

설계 지침

설계 경험 법칙

어떤 참조 설계에서 구축하든, 몇 가지 규칙이 AI 패브릭을 성능과 비용 곡선의 올바른 쪽에 유지시킵니다.

  • 토폴로지를 GPU 수에 맞추세요. 가장 작은 파드(단일 리프의 NIC radix 미만): rail-only로 충분합니다. 단일 파드 규모: rail-optimized 리프-스파인. 멀티 파드: 3-스테이지 Clos는 오버서브스크립션 타협 없이 확장할 수 있는 유일한 설계입니다.
  • AI 플레인에서 항상 1:1 subscription. 스토리지 및 CPU 랙은 더 높은 oversubscription 비율로 운영할 수 있습니다. GPU 플레인은 그래서는 안 됩니다.
  • 레일 수는 케이블링 편의가 아니라 xCCL을 기준으로 결정합니다. 8 rail은 현재 8-NIC GPU 서버의 사실상 표준입니다. rail을 더 적은 수의 leaf로 결합하지 마십시오.
  • 배지가 아닌 전력과 밀도로 실리콘을 선택하십시오. TH4(25.6T)와 TH5(51.2T)가 핵심 주력 제품이며, 둘 사이의 선택은 랙 전력과 breakout 케이블 비용에 달려 있습니다.
  • 설계 단계에서 GLB / UEC를 계획하십시오. 7.0 패브릭에서도 첫날부터 텔레메트리 플레인을 구축해 두면, OcNOS 7.1 GLB 업그레이드가 순수한 소프트웨어 단계만으로 끝납니다. 참고: GLB and Ultra Ethernet.
  • HCL 기준으로 검증하십시오. 여기 모든 레퍼런스는 다음에 나열된 하드웨어 기반으로 구축되었습니다 OcNOS 하드웨어 호환성 목록; 거기서부터 최상급 지원을 선택하십시오.
자주 묻는 질문

AI 패브릭 토폴로지 FAQ

rail-optimized 토폴로지란 무엇이며, rail-only와 어떻게 다릅니까?
Rail-optimized wiring connects each of a GPU server's 8 NICs to its own dedicated rail leaf, so the dominant same-rail AllReduce traffic stays on one leaf and never traverses the spine. Rail-only 는 소규모 클러스터 사례입니다. spine 계층이 없는 rail 정렬 leaf의 단일 랙 행으로, rail 간 트래픽이 GPU scale-up 도메인에 의존합니다. Rail-optimized는 논블로킹 spine을 추가하여 rail 간 플로우가 네트워크 경로를 갖도록 합니다.
3단계 Clos는 몇 개의 GPU까지 확장할 수 있습니까?
각 800G 포트가 GPU에 어떻게 매핑되는지에 따라 다릅니다. radix-64 Tomahawk 5 스위치에서 2계층 leaf-spine은 GPU당 하나의 800G 패브릭 포트 기준으로 약 2,048개 GPU(1:1 논블로킹)에 도달하며, 800G 포트를 여러 GPU NIC으로 분할하면 8,000개 이상의 GPU로 확장됩니다. super-spine 계층을 갖춘 3단계 Clos는 위의 참조 설계에서 이를 16,000개 이상으로 확장하고, 이론적 fat-tree 한계에서는 약 65,000개 GPU까지 확장합니다. 대부분의 collective 트래픽이 rail 로컬에 머물기 때문에, super-spine 플레인은 실제로 필요한 파드 간 비율에 맞춰 사이징됩니다.
Tomahawk 4와 Tomahawk 5 중 무엇을 사용해야 합니까?
둘 다 OcNOS-DC를 실행합니다. Tomahawk 4 (25.6 Tbps, 64×400G)는 엔트리 파드와 400G GPU NIC을 위한 비용 최적화 선택지입니다. Tomahawk 5 (51.2 Tbps, 64×800G)는 800G GPU 서버와 더 큰 패브릭을 위한 핵심 장비입니다. Tomahawk 4에는 네이티브 800G가 없으므로, NIC 속도에 맞춰 스위치를 선택하십시오.
InfiniBand가 필요합니까, 아니면 이더넷으로 충분합니까?
이더넷은 이제 일급 AI 패브릭 트랜스포트입니다. PFC와 ECN을 갖춘 RoCEv2는 오늘날 무손실 RDMA를 제공합니다. Ultra Ethernet (UEC) 는 UEC NIC이 출시됨에 따라 엔드포인트 packet spray, 선택적 재전송, 링크 수준 재시도를 사용하여 네트워크 전체의 PFC 의존성을 제거합니다. OcNOS-DC는 오늘날 RoCEv2 패브릭을 운영하며 UEC 지원 준비가 되어 있습니다.
scale-up은 어디서 끝나고 scale-out은 어디서 시작됩니까?
GPU 서버와 그 NVLink 도메인 내부(예: GB200 NVL72)에서 GPU는 테라비트 속도의 scale-up 패브릭을 통해 통신합니다. rail, leaf-spine, Clos 네트워크는 서버와 파드 사이의 scale-out 패브릭입니다. 대부분의 동일 rail collective 트래픽은 scale-up이 먼저 흡수하므로, 네트워크는 rail 간 및 파드 간 나머지를 전달합니다. 이것이 GPU 플레인에서 1:1 논블로킹이 가장 중요한 이유입니다.

AI 패브릭을 설계 중이신가요? 포트 수 계산을 함께 진행하겠습니다.

워크로드와 GPU 규모를 알려주시면 IP Infusion 엔지니어가 함께 leaf, spine, super-spine 계층을 사이징해 드리며, AI Fabric Design Suite에서 1차 레이아웃으로 시작하실 수도 있습니다.

AI 패브릭

OcNOS로 전체 AI 패브릭을 설계하십시오

비즈니스 사례부터 포트 수 계산까지, 구축 과정의 어느 단계에서든 이어서 진행하십시오.