UDP 4791 · PFC + ECN · DCQCN

RoCEv2: AI 패브릭을 위한 무손실 이더넷

RoCEv2는 RDMA가 표준 이더넷에서 실행되는 방식입니다. RDMA를 UDP/IP로 인캡슐화하고 UDP 목적지 포트 4791을 사용하므로, GPU collective 트래픽을 일반 leaf-spine 패브릭 전반에서 라우팅할 수 있습니다. 이는 PFC와 ECN으로 구축된 무손실 패브릭과 혼잡 제어 루프인 DCQCN을 필요로 하며, OcNOS는 지원되는 400G 및 800G 개방형 하드웨어에서 오늘날 그 전체 툴킷을 제공합니다.

UDP 4791RoCEv2 목적지 포트
최대 800G개방형 RoCEv2 플랫폼
1 NOS개방형 하드웨어의 OcNOS-DC
256에서 4,096GPU 레퍼런스 디자인
무손실 패브릭

무손실 leaf-spine 패브릭 위의 동일한 GPU

간결한 rail 슬라이스: 네 개의 GPU 사이에서 RoCEv2를 전달하는 두 개의 spine과 두 개의 leaf입니다. PFC 일시 정지 프레임은 혼잡 시 홉 단위로 이동하고, ECN은 소스에서의 DCQCN 반응을 위해 엘리펀트 플로우를 마킹합니다. RDMA는 목적지 포트 4791에서 UDP/IP로 인캡슐화되므로, 동일한 트래픽을 표준 이더넷 패브릭 전반에서 라우팅할 수 있습니다.

RoCEv2 AI 패브릭 토폴로지: 두 개의 스파인, 두 개의 리프, 네 개의 GPU로 구성되며 무손실 RoCEv2 트래픽에 PFC 일시 정지 화살표 표시
RoCEv2: PFC 일시 정지 흐름으로 무손실 GPU 트래픽을 전달하는 2-스파인, 2-리프 AI 패브릭.
AI fabric에 RoCEv2가 중요한 이유

거의 제로에 가까운 손실이 GPU collective를 효율적으로 유지합니다

GPU collective(all-reduce, all-gather, all-to-all)는 단일 패브릭 경로를 포화시키는 엘리펀트 플로우를 생성하며, 학습 작업을 효율적으로 유지하기 위해 거의 제로에 가까운 손실을 요구합니다. 400G RoCEv2 링크에서 단일 패킷을 드롭하면 해당 NIC이 전체 RDMA 전송 윈도우를 재전송하며, 이는 수 초의 GPU 유휴 시간으로 측정됩니다. RoCEv2는 RDMA를 목적지 포트 4791에서 UDP/IP로 인캡슐화하여 이러한 워크로드를 위해 leaf-spine 패브릭을 무손실 트랜스포트로 전환하므로, 동일한 트래픽을 Layer 3 전반에서 라우팅할 수 있습니다.

Parameter RoCEv1레이어 2 RoCEv2UDP/IP, 라우팅 가능
Encapsulation이더넷 위에서 직접 전달되는 RDMA(전용 EtherType).UDP 목적지 포트 4791을 사용하여 UDP/IP로 인캡슐화된 RDMA.
네트워크 계층Layer 2 전용이며, 단일 브로드캐스트 도메인에 국한됩니다.표준 leaf-spine 패브릭 전반에서 Layer 3 라우팅 가능.
ECMP 엔트로피해싱할 IP 또는 UDP 헤더가 없어 경로 분산이 제한됩니다.ECMP 경로 전반에 트래픽을 분산하기 위해 UDP 소스 포트를 플로우 식별자로 변화시킵니다.
무손실 요구 사항PFC와 ECN으로 구축된 무손실 패브릭이 필요합니다.혼잡 제어 루프인 DCQCN과 함께, PFC와 ECN으로 구축된 무손실 패브릭이 필요합니다.
도달 거리 및 규모랙 또는 단일 서브넷 내부.라우팅되는 데이터센터 패브릭이며, 256개에서 4,096개 GPU 클러스터를 위한 참조 설계.
설계상 무손실

패브릭을 무손실로 유지하는 제어

RoCEv2 패브릭은 세 가지 협력 메커니즘을 통해 무손실을 유지합니다. priority flow control은 올바른 트래픽 클래스를 일시 정지시키고, ECN과 DCQCN은 손실 없이 처리량을 유지하며, 적응형 라우팅은 소수의 대형 플로우를 혼잡한 업링크에서 회피시킵니다.

Priority Flow Control

우선순위별 pause

802.1Qbb PFC는 단일 트래픽 클래스를 홉 단위로 일시 정지시켜 RDMA를 전달하는 큐가 절대 드롭되지 않도록 합니다. OcNOS는 이를 다음과 결합합니다 PFC 데드록 워치독 정체된 우선순위를 감지하고 전파되기 전에 자동 복구합니다.

혼잡 제어

ECN 마킹과 DCQCN 루프

WRED 기반 ECN은 큐가 쌓임에 따라 패킷을 마킹하며, DCQCN은 혼잡 제어 루프입니다 이는 소스에서 반응하여 손실 없이 처리량을 유지합니다. xCCL collective를 위한 튜닝된 기본값과, 커스텀 RDMA 스택을 위한 파라미터 재정의를 제공합니다.

로드 밸런싱

적응형 플로우렛 라우팅

정적 ECMP 해싱은 AI collective가 생성하는 소수의 대형 엘리펀트 플로우에서 충돌합니다. DLB 서브 밀리초 단위의 윈도우에서 로컬 링크 포화에 따라 플로우렛을 재배치하여, 대칭 토폴로지를 저해하는 정적 해싱 충돌을 제거합니다.

OcNOS 구현

OcNOS가 제공하는 RoCEv2

무손실 제어를 넘어, OcNOS는 무손실 구성을 운영 가능한 패브릭으로 전환하는 텔레메트리, 참조 설계, 그리고 깔끔한 업그레이드 경로를 제공합니다.

텔레메트리

우선순위별 큐 통계

큐 깊이, PFC 일시 정지 카운터, ECN 마킹된 패킷, 마이크로버스트 감지를 위한 gNMI 스트리밍 센서로, 다음 주기로 내보냅니다 10초 샘플 간격 패브릭 전체 관측성을 위해.

참조 설계

레일 최적화 패브릭

rail 정렬 및 스케줄드 패브릭 토폴로지를 위한 참조 설계로, 다음을 아우릅니다 256개에서 4,096개 GPU 클러스터 기성 400G 및 800G 개방형 스위치에서. CLI 진단이 검증된 무손실 구성을 종단 간으로 확인합니다.

차세대 트랜스포트

Ultra Ethernet으로 가는 깔끔한 경로

오늘 무손실 RoCEv2를 구축하고 다음으로 가는 개방형 경로를 유지하십시오 Ultra Ethernet. 이는 UEC NIC이 출시됨에 따라 표준 이더넷에 packet spray와 멀티패스 RDMA를 더합니다. 하나의 NOS가 둘 다 담당합니다.

Why OcNOS

개방형 하드웨어 전반의 하나의 NOS 이미지

RoCEv2 툴킷은 유료 부가 기능 세트가 아니라 기본 OcNOS-DC 라이선스의 일부이며, 멀티벤더 하드웨어 선택 전반에서 변경 없이 실행됩니다.

  • 개방형 하드웨어 선택권. 동일한 NOS 이미지로 UfiSpace, Edgecore 또는 Celestica 플랫폼에서 RoCEv2를 실행하므로, 패브릭 계층에 벤더 종속이 없습니다.
  • 도입 첫날부터 동일한 기능 제공. 적응형 로드 밸런싱, DCQCN 튜닝, ASIC 네이티브 텔레메트리는 유료 부가 기능이 아니라 기본 OcNOS-DC 라이선스의 일부입니다.
  • 레퍼런스 디자인. 널리 사용되는 AI 패브릭 토폴로지를 위한 참조 구성으로, 구성과 테스트 결과가 공개됩니다.
  • 엔지니어링 액세스. 프리미엄 지원 등급은 패브릭 브링업 중 OcNOS RoCEv2 팀과의 직접 소통을 포함합니다.
IP Infusion의 관점

표준 이더넷, RDMA 성능, 개방형 하드웨어

RoCEv2는 AI 패브릭이 나머지 데이터센터가 이미 운영 중인 이더넷 운영 방식과 장비를 재사용하도록 하며, OcNOS는 개방형 스위치에서 이를 무손실로 만드는 조력자입니다.

표준 이더넷, RDMA 속도

RoCEv2는 라우팅 가능한 UDP/IP 위에서 RDMA를 전달하므로, GPU collective는 별도의 전용 패브릭 없이 저지연·저CPU 데이터 이동을 얻습니다.

개방형 하드웨어 선택

동일한 무손실 구성이 400G 및 800G에서 UfiSpace, Edgecore, Celestica 스위치 전반에 실행되어 패브릭 계층을 멀티벤더로 유지합니다.

OcNOS가 조력자입니다

PFC, ECN, DCQCN, DLB, 우선순위별 텔레메트리가 개방형 스위치에서 하나의 NOS로 제공되므로, 완전한 무손실 패브릭은 통합 프로젝트가 아니라 하나의 구축입니다.

자주 묻는 질문

RoCEv2, 자주 묻는 질문

RoCEv2이란 무엇입니까?
RoCEv2(RDMA over Converged Ethernet version 2)는 라우팅 가능한 UDP/IP 네트워크 상에서 RDMA 트래픽을 전달하여, 서버가 매우 낮은 지연과 낮은 CPU 오버헤드로 메모리 간 데이터를 직접 이동할 수 있게 합니다. Ethernet fabric 상의 AI 클러스터와 고속 스토리지에 널리 사용됩니다.
RoCEv2와 RoCEv1의 차이는 무엇입니까?
RoCEv2는 RDMA를 UDP/IP 위에서 실행하므로 Layer 3 네트워크를 가로질러 라우팅할 수 있는 반면, RoCEv1은 Ethernet(Layer 2) 위에서 직접 실행되어 단일 브로드캐스트 도메인 내에 머뭅니다. RoCEv2는 RoCEv1이 도달할 수 없는 더 크고 라우팅된 data center fabric으로 확장됩니다.
RoCEv2 에는 lossless 네트워크가 필요합니까?
RoCEv2 는 패킷이 손실되면 RDMA 성능이 급격히 저하되므로 lossless 또는 그에 준하는 fabric 이 필요합니다. 운영자는 흐름 제어에 PFC 를, 혼잡 제어에 DCQCN 을 적용한 ECN 을 사용하여 이를 구현하며, 큐를 얕게 유지함으로써 RDMA 플로우가 폐기와 재전송을 피하도록 합니다.
RoCEv2는 어떤 UDP 포트를 사용합니까?
RoCEv2는 RoCEv2 트래픽용으로 IANA가 예약한 목적지 UDP 포트 4791을 사용합니다. RDMA는 UDP/IP에 캡슐화되므로 패킷은 라우팅 가능하며, UDP 소스 포트를 플로우 식별자로 변화시켜 트래픽을 ECMP 경로 전반에 분산할 수 있습니다.
RoCEv2 는 InfiniBand 와 비교하면 어떻습니까?
RoCEv2는 표준 Ethernet 및 IP 위에서 RDMA를 제공하는 반면, InfiniBand는 자체 스위치와 어댑터를 갖춘 별도의 전용 설계 fabric입니다. RoCEv2는 Ethernet 운영과 장비를 재사용하므로, 많은 AI 및 스토리지 네트워크가 전용 InfiniBand fabric 대신 이를 채택합니다.

AI 패브릭을 구축하거나 확장하고 계신가요? 워크로드에 특화된 검토를 받아보십시오

GPU 규모와 collective 패턴을 알려주시면 IP Infusion 엔지니어가 함께 스위치 계층을 사이징하고 무손실 구성을 튜닝해 드리며, AI Fabric Design Suite에서 1차 leaf-spine 레이아웃으로 시작하실 수도 있습니다.