Dynamic Load Balancing: AI Fabric를 위한 Adaptive Routing

정적 해시 ECMP은 GPU collective가 아니라 north-south 웹 트래픽을 위해 만들어졌습니다. OcNOS Dynamic Load Balancing(DLB)은 1밀리초 미만 간격으로 flowlet을 덜 혼잡한 경로에 재배치하여, 분산 학습 워크로드에서 Ethernet과 InfiniBand 간의 격차를 좁힙니다.

Leaf-Spine 패브릭에서의 Adaptive Routing

GPU AllReduce 트래픽을 전달하는 4-spine, 2-leaf 슬라이스. DLB는 로컬 egress queue 깊이를 실시간으로 측정합니다. Spine-3이 포화되면 leaf는 다음 flowlet을 Spine-2로 재배치하여 4개 uplink 모두의 균형을 유지합니다.

AI leaf-spine fabric 전반의 Dynamic Load Balancing 4-spine, 2-leaf AI 패브릭입니다. leaf에 연결된 GPU 서버가 AllReduce 플로우를 전송합니다. 세 개의 spine 경로가 균형 잡힌 flowlet을 전달합니다. 네 번째 spine은 혼잡(빨간색) 상태이며, Dynamic Load Balancing이 다음 flowlet을 부하가 더 적은 spine으로 재배치합니다. 하단 밴드는 DLB 지표를 표시합니다: 큐 깊이, 포트 사용률, flowlet 재배치. Spine-3 혼잡 → 다음 flowlet이 Spine-2로 재바인딩 Spine-1 큐 18% Spine-2 큐 22% Spine-3 큐 92% Spine-4 큐 25% Leaf-1 DLB · flowlet Leaf-2 DLB · flowlet GPU-0 GPU-1 GPU-2 GPU-3 DLB · QUEUE-DEPTH FEEDBACK · FLOWLET REBIND · CONGESTION-AWARE ECMP

AI 패브릭에서 정적 ECMP가 실패하는 이유

표준 ECMP은 플로우 시작 시점에 5-tuple을 해싱하여 송신 포트를 선택하고, 해당 플로우의 전체 수명 동안 그 포트에 고정합니다. 수백만 개의 단기 플로우로 구성된 north-south 웹 트래픽에서는 대수의 법칙에 따라 경로 전반의 사용률이 고르게 평준화됩니다. 반면 AI fabric에서는 소수의 elephant flow GPU 집합 통신(AllReduce, AllGather, All-to-All)에서 발생하며, 각각이 한 번에 수 초 동안 400G 또는 800G 업링크 전체를 소모합니다. 동일한 업링크에 해싱된 두 개의 elephant flow는 해당 작업이 지속되는 동안 충돌하는 반면, 다른 업링크는 유휴 상태로 남습니다.

The result is hash polarisation: measured fabric utilisation around 50-60% with random hot-spots, and tail-latency outliers that stall the entire training job. DLB closes this gap by re-evaluating the path decision on every flowlet, a sub-flow chunk delimited by a small inter-packet gap, using live egress queue-depth and port-utilisation telemetry from the ASIC. To size a leaf-spine fabric for your GPU cluster, use the AI Fabric 사이징 도구.

OcNOS DLB 구현

Flowlet 탐지

밀리초 미만 갭 타이머

ASIC-native flowlet inactivity timer (typical 16-256 µs) splits long elephant flows into chunks safe to spray across paths without TCP/RoCEv2 reordering.

경로 품질

실시간 큐 깊이 피드백

DLB는 Tomahawk 파이프라인으로부터 이그레스 포트별 큐 점유율 및 링크 사용률 신호를 받아, 모든 ECMP 넥스트홉을 실시간으로 점수화합니다.

Re-bind

적응형 next-hop 선택

flowlet 경계에서 가장 품질이 높은 member가 선택됩니다. member 품질은 수 마이크로초마다 재계산되므로, 포화된 spine은 하나의 flowlet 내에 후보 집합에서 제외됩니다.

Lossless

PFC 및 ECN과 협조 튜닝

DLB는 RoCEv2 무손실 스택 (PFC, ECN/DCQCN, 헤드룸 계산)과 통합되므로, pause 프레임이 업스트림으로 전파되기 전에 flowlet 재바인딩이 이루어집니다.

텔레메트리

gNMI 내보내기

멤버별 rebind 횟수, flowlet-gap 분포, 멤버 품질 점수가 폐루프 fabric 튜닝을 위해 gNMI dial-out으로 스트리밍됩니다.

하드웨어

TH4 / TH5 네이티브

Broadcom Tomahawk 4(25.6T) 및 Tomahawk 5(51.2T) 스파인 플랫폼에서 64×400G 및 64×800G 포트 구성으로 검증되었으며, 소프트웨어 패스트패스 성능 저하가 없습니다.

상용 AI 패브릭에서 DLB가 제공하는 효과

  • 활용도 향상. 업계에 공개된 flowlet 재조정 벤치마크에 따르면, 동일한 하드웨어에서 추가 uplink 구매 없이 패브릭 사용률이 static ECMP의 약 55%에서 90% 이상으로 향상됩니다.
  • 테일 레이턴시 감소. 다른 링크가 유휴 상태로 있는 동안 어느 단일 링크도 포화되지 않으므로 P99.9 collective 완료 시간이 단축됩니다.
  • 더 빠른 학습. 가장 느린 rank를 기다리며 GPU가 유휴 상태로 머무는 시간이 줄어들면, AllReduce 집약적 워크로드에서 측정 가능한 실제 처리 시간 개선이 나타납니다.
  • NIC 변경 불필요. DLB는 스위치 ASIC에서 동작합니다. 기존 RoCEv2 NIC와 xCCL (NCCL / RCCL / oneCCL) 컬렉티브 스택은 코드 변경 없이 올바른 순서로 전달받습니다.
  • 하나의 라이선스. DLB는 OcNOS-DC PLUS SKU에 포함되어 있습니다: 같은 이미지, 같은 지원 계약, 기능별 추가 비용 없음.

GPU 패브릭을 위한 DLB를 튜닝하고 계십니까?

기술 데모 요청하기 →
자주 묻는 질문

자주 묻는 질문

flowlet이란 무엇이며 DLB는 왜 이를 사용합니까?
flowlet 은 패킷 간의 작은 간격으로 구분되는 서브플로우 단위의 조각입니다. DLB 는 전체 플로우를 고정하는 대신 각 flowlet 경계에서 경로를 재평가하므로, RoCEv2 나 TCP 의 순서 재정렬을 유발하지 않으면서 트래픽을 혼잡이 적은 uplink 로 이동시킵니다.
DLB 는 정적 ECMP 와 어떻게 다릅니까?
정적 ECMP는 플로우 시작 시 5-튜플을 해싱하여 해당 플로우를 수명 동안 고정합니다. 그 결과 두 개의 GPU 엘리펀트 플로우가 하나의 업링크에서 충돌하는 동안 다른 업링크는 유휴 상태로 남을 수 있습니다. DLB는 실시간 큐 깊이를 사용하여 모든 next-hop을 실시간으로 평가하고 플로우렛을 최적 경로로 다시 바인딩합니다.
DLB에는 새로운 NIC나 집합 연산 라이브러리의 변경이 필요합니까?
아니요. DLB는 스위치 ASIC 내에서 동작하므로, 기존 RoCEv2 NIC와 xCCL(NCCL, RCCL, oneCCL) 집합 연산 스택은 코드 변경 없이 올바른 순서대로의 전달을 얻습니다.
어떤 하드웨어가 OcNOS DLB를 지원합니까?
DLB는 Broadcom Tomahawk 4(25.6T) 및 Tomahawk 5(51.2T) 플랫폼의 64x400G 및 64x800G 구성에서 지원되며, 기능별 추가 구매 없이 OcNOS-DC PLUS SKU에 포함됩니다.
솔루션 브리프

더 깊이 살펴보십시오. 자료를 소장하십시오.

본 페이지보다 한 걸음 더 나아간 간결하고 기술적인 두 건의 다운로드 자료입니다. lossless 800G AI fabric 아키텍처와 EVPN-VXLAN data center 레퍼런스를 제공합니다.