OcNOS 7.1 로드맵 · 종단 간 · DLB 위에 계층화

Global Load Balancing: 패브릭 전반의 적응형 라우팅

DLB는 하나의 홉에서 올바른 결정을 내리고, GLB는 전체 패브릭에 걸쳐 올바른 결정을 내립니다. OcNOS 7.1 로드맵에서 Global Load Balancing은 적응형 라우팅을 포트별 관점에서 종단 간 경로 품질로 확장하여, 16,384-GPU 상한까지의 3단계 Clos AI 패브릭에서 멀티홉 핫스팟 격차를 좁힙니다. GLB는 DLB를 대체하는 것이 아니라 그 위에 계층화됩니다.

OcNOS 7.1GLB 목표 릴리스
End-to-end로컬 홉이 아닌 경로 스코어링
16,384GPU 상한, 참조 설계
DLB 위에 계층화확장할 뿐, 대체하지 않음
종단 간 경로 텔레메트리

로컬 홉만이 아니라 전체 경로를 평가

3단계 Clos 슬라이스(leaf, spine, super-spine)가 GPU AllReduce를 전달합니다. 모든 계층이 큐 점유율과 링크 활용률 텔레메트리를 인그레스 leaf 쪽으로 스트리밍합니다. GLB는 최적의 로컬 이그레스 점수가 아니라 최적의 종단 간 점수를 가진 경로를 선택하므로, 혼잡한 다운링크에 도달하는 깨끗한 업링크가 더 이상 무턱대고 선택되지 않습니다.

3-stage Clos AI fabric 전반의 Global Load Balancing 3단 Clos AI 패브릭입니다. 상단에 두 개의 슈퍼 스파인, 중간에 네 개의 스파인, 하단에 두 개의 리프가 있습니다. 텔레메트리 화살표는 위로 흐른 뒤 다시 아래로 흐르므로 인그레스 리프가 종단 간 경로 품질을 확인할 수 있습니다. 하나의 스파인-슈퍼 스파인 링크가 혼잡 상태가 되어 대체 종단 간 경로를 위해 우회됩니다. 엔드투엔드 텔레메트리 Super-Spine-1TH5 · 51.2T Super-Spine-2TH5 · 51.2T Spine-1e2e ok Spine-2e2e ok Spine-3업링크 과부하 Spine-4e2e ok 인그레스 LeafGLB · ranks paths 이그레스 리프대상 랙 GLB · END-TO-END PATH SCORING · MULTI-HOP CONGESTION AWARENESS · OcNOS 7.1
로컬 관점이 무너지는 지점

DLB와 GLB, 경로 결정 범위별

DLB는 로컬 이그레스 큐 깊이를 사용하여 각 ECMP 넥스트홉을 평가하며, 이는 2계층 leaf-spine에서 최적입니다. 3계층 Clos로 확장하면, 깨끗한 업링크를 가진 spine을 선택했다가 이그레스 leaf로 돌아가는 다운링크가 혼잡한 super-spine에 도달할 수 있습니다. 로컬 관점은 옳지만 종단 간 관점은 틀립니다. super-spine을 갖춘 3단계 Clos가 표준이 되는 1,024-GPU 이상 패브릭에서는, 이것이 테일 레이턴시 이상치의 주된 잔여 원인입니다.

Axis DLB로컬, 오늘 제공 중 GLB글로벌, OcNOS 7.1 로드맵
결정 범위홉별: 각 스위치가 자체 ECMP 넥스트홉의 순위를 매깁니다.종단 간: 인그레스 leaf가 완전한 leaf 대 leaf 경로의 순위를 매깁니다.
Signal used이 스위치의 로컬 이그레스 큐 깊이 및 링크 활용률.모든 계층에서 인그레스로 집계된 혼잡 텔레메트리.
가장 적합한 선택2계층 패브릭 및 3계층의 leaf 대 spine 홉.super-spine을 갖춘 3단계 Clos, 16,384-GPU 상한까지.
포착되는 핫스팟로컬 이그레스 혼잡만.로컬 홉이 볼 수 없는 다운스트림 핫스팟.
Rebinding플로우렛 정렬, RoCEv2 및 TCP에 대해 순차 유지.플로우렛 정렬, 동일한 순차 보장, 전체 패브릭 입력.
하드웨어오늘날의 TH4 및 TH5.동일한 TH4 및 TH5 하드웨어, 새로운 실리콘 없음.
Relationship각 스위치에서의 독립적 결정.DLB 위에 계층화되며, 이를 대체하지 않습니다.
GLB가 이를 좁히는 방식

전체 패브릭 정보를 반영한 하나의 결정

GLB는 사업자가 이미 운영 중인 적응형 라우팅 메커니즘을 재사용하고 그 위에 패브릭 전체 인식을 더합니다. DLB와 RoCEv2 위에 직접 구축되며, Ultra Ethernet이 나아가는 방향과 일관성을 유지합니다.

Builds on

DLB 결정

GLB는 다음을 확장합니다 DLB 플로우렛 결정을 대체하는 대신 확장합니다. 혼합 패브릭도 올바르게 동작합니다. 비-GLB 스위치는 롤링 업그레이드 중 로컬 전용 경로 품질만 기여합니다.

Runs over

무손실 RoCEv2 패브릭

GLB는 플로우렛 경계에서 재배치하여, 다음이 필요로 하는 순차 전달을 보존합니다 RoCEv2 RDMA. 트랜스포트는 프로덕션 수준을 유지하며, 경로 입력만 더 똑똑해집니다.

다음에 부합

Ultra Ethernet 시그널링

경로 품질 플레인은 다음과 상호운용하도록 설계되고 있습니다 Ultra Ethernet UEC NIC 생태계가 성숙함에 따라 컨소시엄 시그널링과, 따라서 로드맵은 상위 호환성을 유지합니다.

OcNOS 7.1 내부

계획된 GLB 구현이 어떻게 맞물리는가

GLB는 개방형 Broadcom 기반 하드웨어에서 네트워크 운영체제인 OcNOS에 의해 구현됩니다. 이 설계는 컨트롤 플레인을 조용하게 유지하고, 사업자가 패브릭의 결정을 신뢰하는 데 필요한 텔레메트리를 제공합니다.

텔레메트리 플레인

경로 품질 게시

모든 spine과 super-spine이 포트별 큐 점유율과 활용률 델타를 패브릭 전체 인접성에 게시합니다. 업데이트는 기존 인밴드 시그널링을 통해 서브 밀리초 단위로 이루어지며, 추가적인 컨트롤 플레인 트래픽이 없습니다.

경로 스코어링

엔드투엔드 애그리게이션

인그레스 leaf는 로컬 이그레스 품질과 다운스트림 텔레메트리를 결합하여 후보 경로별 종합 점수를 산출합니다. 가장 나쁜 홉이 점수를 좌우하며, 이는 사업자가 문제를 해결할 때 사용하는 직관과 동일합니다.

Selection

Flowlet-aligned

DLB와 마찬가지로 GLB는 flowlet 경계에서 재바인딩하여 RoCEv2와 TCP의 순서 보장 전달을 유지합니다. 차이는 판단의 근거에 있습니다. 로컬 포트 품질이 아니라 패브릭 전체 품질을 기준으로 합니다.

Backwards-compatible

DLB 위에 계층화

GLB는 DLB 결정을 확장할 뿐 대체하지 않습니다. GLB 지원 스위치와 DLB 전용 스위치가 혼합된 패브릭도 올바르게 동작하므로, 7.0에서의 브라운필드 업그레이드가 안전합니다.

Scale

최대 16k-GPU 한도까지

참조 설계는 256개의 spine 스위치와 128개의 super-spine 스위치를 사용하며, 각각 64x800G Tomahawk 5로 16,384-GPU 아키텍처 상한에 맞춰 사이징됩니다.

텔레메트리 출력

운영팀을 위한 gNMI

경로별 점수, 재배치 이벤트, 최악 홉 귀속이 gNMI 및 OpenConfig를 통해 스트리밍되므로, SRE는 블랙박스 없이 패브릭 결정을 xCCL collective 작업 동작과 상관 지을 수 있습니다.

로드맵 및 가용성

GLB 출시 시 기대할 수 있는 것

GLB는 OcNOS 7.1 로드맵에 있습니다. 사업자가 이미 운영 중인 동일한 하드웨어와 라이선스를 대상으로 하므로, 이를 도입하는 것은 전면 교체가 아니라 업그레이드입니다.

  • OcNOS 7.1 로드맵. GLB는 오늘날 DLB를 실행하는 동일한 TH4 및 TH5 하드웨어에서 7.1 OcNOS-DC 트레인을 대상으로 합니다. 일정 및 기능 범위는 다음에서 확인하십시오 OcNOS 릴리스 페이지.
  • 동일 SKU. OcNOS-DC PLUS로 계획됨: 기능별 유료 장벽이 없고, 업그레이드 시 새로운 라이선스 키가 없습니다.
  • 무중단 업그레이드. 7.0에서 7.1로의 brownfield 업그레이드가 지원되며, 혼합 버전 fabric은 업그레이드 기간 동안 DLB 전용 동작으로 정상 작동을 유지합니다.
  • UEC-aligned. 경로 품질 플레인은 UEC NIC 생태계가 성숙하면 Ultra Ethernet Consortium 시그널링과 상호운용하도록 설계되고 있습니다. 다음을 참조하십시오 Ultra Ethernet (UEC).
  • 아키텍처 검토 제공 가능. 1,000개 이상의 GPU 패브릭을 사이징 중이시라면, GLB 텔레메트리 플레인을 포함한 사이징 작업을 진행해 드립니다. 다음으로 1차 leaf-spine 레이아웃을 받아보십시오 AI Fabric Design Suite.
IP Infusion의 관점

오늘은 DLB가 기준이고, 다음은 GLB가 상한을 높입니다

적응형 라우팅은 이미 2계층 규모에서 실제 테일 레이턴시를 해결하고 있습니다. GLB는 그 동일한 규율을 가장 큰 클러스터가 존재하는 3단계 패브릭으로, 이미 검증하신 개방형 하드웨어에서 끌어올립니다.

DLB는 일반적인 경우를 해결합니다

2계층 leaf-spine과 leaf 대 spine 홉에서, 로컬 적응형 라우팅은 이미 대부분의 ECMP 충돌을 제거합니다. 이는 오늘날 TH4 및 TH5에서 제공되고 있습니다.

GLB는 대규모 경우를 해결합니다

1,024개 GPU 이상에서는 멀티홉 핫스팟이 주된 이상치가 됩니다. GLB는 완전한 경로를 평가하므로, 인그레스 leaf가 깨끗한 업링크를 쫓다가 혼잡한 다운링크에 도달하는 일이 없어집니다.

OcNOS가 조력자입니다

하나의 NOS, 하나의 기능 로드맵: 오늘은 DLB, 다음은 GLB, 전반에 걸쳐 RoCEv2 및 UEC 부합, 단일 벤더 패브릭이 아닌 검증된 개방형 하드웨어에서.

자주 묻는 질문

Global Load Balancing, 자주 묻는 질문

GLB 는 DLB 와 어떻게 다릅니까?
DLB 는 단일 스위치의 로컬 출력 큐 깊이를 사용하여 각 next-hop 을 평가하므로 2 계층 leaf-spine 에서 최적으로 동작합니다. GLB 는 모든 계층의 혼잡 텔레메트리를 집계하므로 ingress leaf 가 leaf 간 전체 경로를 순위화할 수 있으며, 3 단 Clos fabric 에서 로컬 관점으로는 놓치는 다운스트림 핫스팟을 포착합니다.
GLB는 언제 사용할 수 있습니까?
GLB는 OcNOS 7.1 로드맵에 있으며, 오늘날 DLB를 실행하는 동일한 Tomahawk 4 및 5 하드웨어에서 OcNOS-DC 트레인을 대상으로 합니다. OcNOS-DC PLUS SKU로 계획되어 있으며, 업그레이드 시 새로운 라이선스 키가 없습니다.
GLB를 사용하려면 DLB를 교체해야 합니까?
아니요. GLB는 DLB의 판단을 대체하는 것이 아니라 그 위에 계층으로 작동합니다. 혼합 fabric은 정상적으로 동작합니다. GLB를 지원하지 않는 스위치는 단순히 로컬 전용 경로 품질만 제공하며, 7.0에서의 brownfield 업그레이드도 지원됩니다.
GLB 는 어느 정도 규모의 fabric 을 지원합니까?
참조 설계는 256개의 spine 스위치와 128개의 super-spine 스위치를 사용하며, 각각 64x800G Tomahawk 5로 16,384-GPU 아키텍처 상한에 맞춰 사이징됩니다.

수천 개 규모의 GPU 패브릭을 사이징 중이신가요? 함께 수치를 계산해 봅시다

워크로드와 GPU 규모를 알려주시면 IP Infusion 엔지니어가 함께 GLB 텔레메트리 플레인을 사이징해 드리며, AI Fabric Design Suite에서 1차 leaf-spine 레이아웃으로 시작하실 수도 있습니다.