AI Fabric 토폴로지: Rail-Optimized 및 Scheduled 설계
토폴로지를 GPU 수에 맞추십시오. 약 1,000개 GPU까지는 rail-optimized leaf-spine 파드, 16,000개 이상은 3단계 Clos, 그리고 사이트 간 확장에는 코히어런트 DCI입니다. collective 동안 모든 GPU의 링크를 포화 상태로 유지하는, 가장 작은 논블로킹 설계를 선택하십시오. 세 가지 모두 무손실 RoCEv2(PFC + ECN) L3 패브릭 위에서 OcNOS-DC로 실행되며, 여기서는 Broadcom Tomahawk 4 및 Tomahawk 5에서 구체적인 포트 수로 사이징되었습니다.
GPU 수에 맞는 가장 작은 논블로킹 설계
AI 패브릭 토폴로지의 임무는 하나입니다. collective 동안 테일 레이턴시 이상치를 만들지 않으면서 모든 GPU의 아웃바운드 링크를 포화 상태로 유지하는 것입니다. 올바른 토폴로지는 여러분의 GPU 수에 대해 이를 달성하는 가장 작은 것이며, 다음 규모로 넘어갈 때를 위한 대비 경로를 갖춥니다. Broadcom Tomahawk 실리콘에 대한 구체적인 포트 계산과 함께 네 가지 참조 지점을 제시합니다.
2계층 leaf-spine의 상한은 GPU당 하나의 800G 패브릭 포트 기준으로 약 2,048개 GPU이며, 그 이상은 super-spine 계층을 추가합니다. 동일한 OcNOS-DC 이미지가 모든 계층에서 실행되므로, 패브릭은 각 단계마다 재설계되는 대신 클러스터와 함께 scale-out됩니다.
직접 클러스터를 사이징하고 계십니까? The AI Fabric Design Suite 빠른 1차 산정을 제공합니다. GPU당 하나의 패브릭 NIC을 가정하여 논블로킹 2계층 leaf-spine 파드를 사이징하고, 3계층 규모로 넘어가는 시점을 표시합니다. 아래의 참조 설계는 동일한 논블로킹 leaf/spine 계산을 사용하고 이를 대규모에서 3단계 Clos로 확장하므로, 스위치 수가 도구와 일치합니다. 여기서 rail-optimized는 8-NIC GPU 서버의 배선 규율(leaf당 하나의 rail이므로 rail 내부 AllReduce는 leaf에 머무름)을 그 논블로킹 패브릭 위에 얹은 것입니다. 이는 스위치 수가 아니라 트래픽 지역성을 바꿉니다. 대략적인 산정에는 도구를, 실제 구축에는 이 설계를 사용하십시오.
Rail-optimized, 스케줄드 Clos, 그리고 코히어런트 DCI
OcNOS-DC는 단일 파드, 다중 파드, 다중 사이트 AI 패브릭을 아우르는 세 가지 참조 토폴로지에 맞춰 제공됩니다. 각각은 화이트보드 스케치가 아니라 HCL 등재 Broadcom 하드웨어에서 사이징된 구체적인 구축입니다.
Rail-optimized 단일 파드
각 GPU 서버의 8개 NIC이 8개의 전용 rail leaf에 연결됩니다, 따라서 동일 rail의 AllReduce는 하나의 leaf에 머물며 spine을 전혀 거치지 않습니다. 논블로킹 spine이 rail 간 플로우를 전달합니다. 약 1,000개 GPU까지의 단일 파드 확장 단위입니다.
스케줄드 3단계 Clos
Leaf, spine, 그리고 super-spine 계층이 4,096개에서 16,384개 GPU까지 확장됩니다. 각 파드 내에서 논블로킹이며, super-spine 플레인이 파드 간 비율을 설정합니다. 모든 홉에 DLB, OcNOS 7.1 트레인에서 종단 간 GLB.
코히어런트 다중 DC DCI
학습 작업이 여러 데이터 홀에 걸칠 때, 다음으로 패브릭을 확장하십시오 400G ZR / ZR+ 코히어런트 광 트랜시버 를 spine에 적용합니다. 사이트 간 트랜스폰더 없는 DCI이며, 사이트 내 3단계 Clos는 그대로 유지됩니다.
Rail-optimized 단일 파드
각 GPU 서버에는 8개 NIC이 있으며, 각 rail당 하나입니다(각 rail은 전용 xCCL(NCCL / RCCL / oneCCL) collective 채널). 각 rail은 자체 전용 leaf이므로, 모든 서버의 8개 NIC이 서로 다른 leaf에 연결됩니다. rail-N에 걸친 AllReduce는 leaf-N 내부에 머물기 때문에, 지배적인 collective 패턴에 대해 spine에 동서 방향 부하가 발생하지 않습니다.

OcNOS 구성 요소: BGP-unnumbered L3 언더레이, 모든 leaf에서 RoCEv2 무손실(PFC + ECN), spine 계층에서 DLB. HCL 등재 하드웨어 기반 구축: 800G 확장 단위는 TH5 64x800G leaf 및 spine(Edgecore AIS800-64D 또는 UfiSpace S9321-64E)을 사용하고, 엔트리 256-GPU 파드는 Edgecore AS9736-64D(TH4, 64x400G)를 사용합니다.
3단계 Clos 스케줄드 패브릭: 4,096개에서 16,384개 GPU
Rail-optimized는 1k에서 2k GPU 사이 어딘가에서 확장이 멈춥니다. leaf radix가 소진되거나 spine 계층이 지나치게 오버서브스크립션됩니다. 그 이상에서는 대부분의 최신 AI 패브릭이 3단계 Clos, 즉 leaf, spine, super-spine으로 이동합니다. 임의의 두 GPU는 최대 네 개의 스위치 홉만큼 떨어져 있으며, 같은 leaf 및 같은 파드의 피어는 더 가깝습니다.
Clos에서 어려운 부분은 어떤 링크도 핫스팟이 되지 않도록 플로우를 고르게 분산하는 것입니다. 방식은 플로우별 ECMP에서 적응형(동적) 로드 밸런싱을 거쳐 패킷별 spray까지 다양하며, 후자는 Ultra Ethernet이 재정렬을 NIC에서 처리하며 사용하는 모델입니다. 별도 계열로, Broadcom DDC와 같은 셀 기반 스케줄드 패브릭은 트래픽을 셀로 분할하여 패브릭 내부에서 스케줄링합니다. OcNOS는 오늘날 DLB로 GPU 플레인의 균형을 유지하고 7.1 트레인에서 패브릭 전체 GLB를 추가하며, UEC NIC이 도입됨에 따라 UEC 지원 준비를 갖춥니다.
이 다이어그램은 개념도로, 계층 수를 축소하여 그렸습니다. 4,096-GPU 구축은 TH5 800G에서 128 leaf / 64 spine / 32 super-spine입니다.

OcNOS 구성 요소: eBGP-unnumbered L3 언더레이, RoCEv2 무손실(PFC + ECN), 모든 계층에서 DLB, OcNOS 7.1 트레인에서 종단 간 GLB, 그리고 관측성 스택으로의 gNMI 스트리밍 텔레메트리. 전체가 HCL 등재 TH5 64x800G 섀시로 구축됩니다.
오버서브스크립션은 고정된 규칙이 아니라 조절 가능한 다이얼입니다. 이 수치는 각 1,024-GPU 파드를 1:1 논블로킹으로 만들고, 파드 간 트래픽에는 비용 최적화된 약 2:1 super-spine을 사용합니다. 이는 하이퍼스케일 이더넷 패브릭이 의존하는 rail-optimized 접근 방식입니다(공개된 대규모 설계는 collective 트래픽이 파드 로컬에 머물기 때문에 최상위 계층을 훨씬 더 오버서브스크립션합니다). 대신 최대한의 any-to-any 여유를 원하시나요? 완전한 논블로킹 1:1 구축은 4,096개 GPU에서 128 / 128 / 64이고 16,384개에서 512 / 512 / 256이며, spine과 super-spine 수만 바뀝니다. 다음에서 어느 쪽이든 모델링하십시오 AI Fabric Design Suite.
다중 DC AI 패브릭: 코히어런트 DCI
단일 학습 작업이 두 개 이상의 데이터 홀에 걸칠 때(조 단위 파라미터 모델에서 점점 흔해지고 있음), 패브릭은 WAN을 넘어 확장됩니다. OcNOS-DC는 사이트 간 트랜스폰더 없는 DCI를 위해 spine에 직접 400G ZR / ZR+ 코히어런트 광 트랜시버를 지원합니다. 각 사이트의 기반 3단계 Clos는 그대로 유지됩니다.

OcNOS 구성 요소: DWDM 지원 spine 또는 border-leaf 포트의 400G ZR/ZR+ 플러거블 코히어런트 광 트랜시버로, 사이트 간 gNMI 텔레메트리를 갖춥니다. 외부 트랜스폰더가 필요하지 않습니다. 도달 거리: 400ZR은 증폭 시 약 120 km, OpenZR+는 oFEC로 더 멀리 도달합니다.
설계 경험 법칙
어떤 참조 설계에서 구축하든, 몇 가지 규칙이 AI 패브릭을 성능과 비용 곡선의 올바른 쪽에 유지시킵니다.
- 토폴로지를 GPU 수에 맞추세요. 가장 작은 파드(단일 리프의 NIC radix 미만): rail-only로 충분합니다. 단일 파드 규모: rail-optimized 리프-스파인. 멀티 파드: 3-스테이지 Clos는 오버서브스크립션 타협 없이 확장할 수 있는 유일한 설계입니다.
- AI 플레인에서 항상 1:1 subscription. 스토리지 및 CPU 랙은 더 높은 oversubscription 비율로 운영할 수 있습니다. GPU 플레인은 그래서는 안 됩니다.
- 레일 수는 케이블링 편의가 아니라 xCCL을 기준으로 결정합니다. 8 rail은 현재 8-NIC GPU 서버의 사실상 표준입니다. rail을 더 적은 수의 leaf로 결합하지 마십시오.
- 배지가 아닌 전력과 밀도로 실리콘을 선택하십시오. TH4(25.6T)와 TH5(51.2T)가 핵심 주력 제품이며, 둘 사이의 선택은 랙 전력과 breakout 케이블 비용에 달려 있습니다.
- 설계 단계에서 GLB / UEC를 계획하십시오. 7.0 패브릭에서도 첫날부터 텔레메트리 플레인을 구축해 두면, OcNOS 7.1 GLB 업그레이드가 순수한 소프트웨어 단계만으로 끝납니다. 참고: GLB and Ultra Ethernet.
- HCL 기준으로 검증하십시오. 여기 모든 레퍼런스는 다음에 나열된 하드웨어 기반으로 구축되었습니다 OcNOS 하드웨어 호환성 목록; 거기서부터 최상급 지원을 선택하십시오.
AI 패브릭 토폴로지 FAQ
rail-optimized 토폴로지란 무엇이며, rail-only와 어떻게 다릅니까?
3단계 Clos는 몇 개의 GPU까지 확장할 수 있습니까?
Tomahawk 4와 Tomahawk 5 중 무엇을 사용해야 합니까?
InfiniBand가 필요합니까, 아니면 이더넷으로 충분합니까?
scale-up은 어디서 끝나고 scale-out은 어디서 시작됩니까?
더 깊이 살펴보십시오. 자료를 소장하십시오.
제품 데이터시트와 이 페이지보다 한층 더 깊이 있는 간결한 기술 다운로드 자료입니다.
OcNOS-DC 데이터시트
OcNOS-DC 전체 사양: EVPN-VXLAN 및 Ethernet for AI 기능 세트, 소프트웨어 SKU, 지원 하드웨어 플랫폼, 솔루션 주문 가이드.
Datasheet 받기OcNOS 800G 무손실 AI Fabric
Broadcom Tomahawk 4/5 스파인 기반의 논블로킹 RoCEv2 fabric: SKU 등급, 검증된 플랫폼, 도입 아키텍처를 다룹니다.
브리프 받기EVPN-VXLAN 데이터센터 패브릭
통신사업자급 leaf-spine 데이터센터 패브릭: 대칭 IRB, Type-2/Type-5 경로, 그리고 분산 애니캐스트 게이트웨이.
브리프 받기OcNOS-DC 데이터시트
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
OcNOS 800G 무손실 AI Fabric
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
EVPN-VXLAN 데이터센터 패브릭
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
AI 패브릭을 설계 중이신가요? 포트 수 계산을 함께 진행하겠습니다.
워크로드와 GPU 규모를 알려주시면 IP Infusion 엔지니어가 함께 leaf, spine, super-spine 계층을 사이징해 드리며, AI Fabric Design Suite에서 1차 레이아웃으로 시작하실 수도 있습니다.
OcNOS로 전체 AI 패브릭을 설계하십시오
비즈니스 사례부터 포트 수 계산까지, 구축 과정의 어느 단계에서든 이어서 진행하십시오.