Dynamic Load Balancing: AI Fabric를 위한 Adaptive Routing
정적 해시 ECMP은 GPU collective가 아니라 north-south 웹 트래픽을 위해 만들어졌습니다. OcNOS Dynamic Load Balancing(DLB)은 1밀리초 미만 간격으로 flowlet을 덜 혼잡한 경로에 재배치하여, 분산 학습 워크로드에서 Ethernet과 InfiniBand 간의 격차를 좁힙니다.
Leaf-Spine 패브릭에서의 Adaptive Routing
GPU AllReduce 트래픽을 전달하는 4-spine, 2-leaf 슬라이스. DLB는 로컬 egress queue 깊이를 실시간으로 측정합니다. Spine-3이 포화되면 leaf는 다음 flowlet을 Spine-2로 재배치하여 4개 uplink 모두의 균형을 유지합니다.
AI 패브릭에서 정적 ECMP가 실패하는 이유
표준 ECMP은 플로우 시작 시점에 5-tuple을 해싱하여 송신 포트를 선택하고, 해당 플로우의 전체 수명 동안 그 포트에 고정합니다. 수백만 개의 단기 플로우로 구성된 north-south 웹 트래픽에서는 대수의 법칙에 따라 경로 전반의 사용률이 고르게 평준화됩니다. 반면 AI fabric에서는 소수의 elephant flow GPU 집합 통신(AllReduce, AllGather, All-to-All)에서 발생하며, 각각이 한 번에 수 초 동안 400G 또는 800G 업링크 전체를 소모합니다. 동일한 업링크에 해싱된 두 개의 elephant flow는 해당 작업이 지속되는 동안 충돌하는 반면, 다른 업링크는 유휴 상태로 남습니다.
The result is hash polarisation: measured fabric utilisation around 50-60% with random hot-spots, and tail-latency outliers that stall the entire training job. DLB closes this gap by re-evaluating the path decision on every flowlet, a sub-flow chunk delimited by a small inter-packet gap, using live egress queue-depth and port-utilisation telemetry from the ASIC. To size a leaf-spine fabric for your GPU cluster, use the AI Fabric 사이징 도구.
OcNOS DLB 구현
밀리초 미만 갭 타이머
ASIC-native flowlet inactivity timer (typical 16-256 µs) splits long elephant flows into chunks safe to spray across paths without TCP/RoCEv2 reordering.
실시간 큐 깊이 피드백
DLB는 Tomahawk 파이프라인으로부터 이그레스 포트별 큐 점유율 및 링크 사용률 신호를 받아, 모든 ECMP 넥스트홉을 실시간으로 점수화합니다.
적응형 next-hop 선택
flowlet 경계에서 가장 품질이 높은 member가 선택됩니다. member 품질은 수 마이크로초마다 재계산되므로, 포화된 spine은 하나의 flowlet 내에 후보 집합에서 제외됩니다.
PFC 및 ECN과 협조 튜닝
DLB는 RoCEv2 무손실 스택 (PFC, ECN/DCQCN, 헤드룸 계산)과 통합되므로, pause 프레임이 업스트림으로 전파되기 전에 flowlet 재바인딩이 이루어집니다.
gNMI 내보내기
멤버별 rebind 횟수, flowlet-gap 분포, 멤버 품질 점수가 폐루프 fabric 튜닝을 위해 gNMI dial-out으로 스트리밍됩니다.
TH4 / TH5 네이티브
Broadcom Tomahawk 4(25.6T) 및 Tomahawk 5(51.2T) 스파인 플랫폼에서 64×400G 및 64×800G 포트 구성으로 검증되었으며, 소프트웨어 패스트패스 성능 저하가 없습니다.
상용 AI 패브릭에서 DLB가 제공하는 효과
- 활용도 향상. 업계에 공개된 flowlet 재조정 벤치마크에 따르면, 동일한 하드웨어에서 추가 uplink 구매 없이 패브릭 사용률이 static ECMP의 약 55%에서 90% 이상으로 향상됩니다.
- 테일 레이턴시 감소. 다른 링크가 유휴 상태로 있는 동안 어느 단일 링크도 포화되지 않으므로 P99.9 collective 완료 시간이 단축됩니다.
- 더 빠른 학습. 가장 느린 rank를 기다리며 GPU가 유휴 상태로 머무는 시간이 줄어들면, AllReduce 집약적 워크로드에서 측정 가능한 실제 처리 시간 개선이 나타납니다.
- NIC 변경 불필요. DLB는 스위치 ASIC에서 동작합니다. 기존 RoCEv2 NIC와 xCCL (NCCL / RCCL / oneCCL) 컬렉티브 스택은 코드 변경 없이 올바른 순서로 전달받습니다.
- 하나의 라이선스. DLB는 OcNOS-DC PLUS SKU에 포함되어 있습니다: 같은 이미지, 같은 지원 계약, 기능별 추가 비용 없음.
GPU 패브릭을 위한 DLB를 튜닝하고 계십니까?
기술 데모 요청하기 →자주 묻는 질문
flowlet이란 무엇이며 DLB는 왜 이를 사용합니까?
DLB 는 정적 ECMP 와 어떻게 다릅니까?
DLB에는 새로운 NIC나 집합 연산 라이브러리의 변경이 필요합니까?
어떤 하드웨어가 OcNOS DLB를 지원합니까?
더 깊이 살펴보십시오. 자료를 소장하십시오.
본 페이지보다 한 걸음 더 나아간 간결하고 기술적인 두 건의 다운로드 자료입니다. lossless 800G AI fabric 아키텍처와 EVPN-VXLAN data center 레퍼런스를 제공합니다.
OcNOS 800G 무손실 AI Fabric
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
Solution_Brief-OcNOS_800G_Ethernet-Based_Lossless_AI_Fabric.pdfEVPN-VXLAN 데이터센터 패브릭
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
OcNOS-modernize-your-data-center-EVPN-VxLAN_Solution-Brief.pdfDesign the whole AI fabric with OcNOS
From the business case to the port-count maths, pick up wherever you are in the build.