AI back-end · 스토리지 · Front-end · 코히어런트 DCI

AI 데이터센터 패브릭 아키텍처

AI 데이터센터는 하나의 평면 네트워크가 아니라 네 개의 네트워크 플레인을 운영합니다. GPU 대 GPU collective를 위한 AI back-end 패브릭, 스토리지 패브릭, front-end 패브릭, 그리고 격리된 대역 외 관리 플레인입니다. 코히어런트 DCI는 사이트 간 학습을 확장하며, OcNOS-DC는 검증된 Broadcom Tomahawk 하드웨어에서 단일 NOS로 모든 플레인을 운영합니다.

4 planes코히어런트 DCI 포함
1 NOS모든 플레인의 OcNOS-DC
최대 800GTomahawk 5, 64x800G
1 contract하나의 TAC, 하나의 SLA
플레인별 범위

스위치만이 아니라 플레인을 설계하십시오

대부분의 AI 패브릭 실수는 범위 설정 실수입니다. 팀이 GPU 플레인을 사이징한 뒤, 스토리지, 테넌트 접근, 관리를 나중 생각으로 덧붙입니다.

대신 트래픽을 플레인별로 분리하고, 각 플레인에 필요한 서브스크립션 비율과 격리를 부여하십시오. AI back-end 패브릭만 논블로킹이고 무손실이어야 하며, 나머지 세 개는 여기에 속하지 않는 트래픽을 배제하기 위해 존재합니다. 네 개의 플레인 모두와 사이트를 연결하는 코히어런트 링크가 다음에서 실행됩니다 OcNOS-DC on HCL-listed Tomahawk 하드웨어.

네 개의 패브릭

각 플레인은 하나의 임무를 가집니다

각 플레인을 자체 임무에 맞춰 사이징하고 트래픽을 자체 회선에 유지하면, 전체 학습 작업 하에서도 패브릭이 예측 가능하게 유지됩니다.

Plane 1

AI back-end 패브릭

collective를 전달하는 GPU 대 GPU 플레인입니다. 다음으로 구축됩니다 1:1 논블로킹 rail-optimized leaf-spine 파드 또는 3단계 Clos로, 다음 위에 순수 Layer 3 eBGP 언더레이, 그리고 RDMA가 요구하는 RoCEv2 패브릭으로 무손실을 유지합니다: PFC(DCBX/LLDP를 갖춘 L3 상 포함)와 ECN. DLB는 플로우를 분산하여 AllReduce 동안 어떤 링크도 핫스팟이 되지 않도록 합니다.

1:1 논블로킹 · RoCEv2 (PFC + ECN) · DLB · TH5 800G
Plane 2

스토리지 패브릭

GPU 랙과 NVMe-oF 또는 NFS 스토리지 사이에서 체크포인트와 데이터셋을 이동하는 leaf-spine Clos입니다. 일반적으로 다음 근처로 사이징됩니다 3:1, 스토리지 버스트는 collective보다 더 많은 오버서브스크립션을 허용하기 때문이며, RDMA 스토리지 트래픽이 부하 하에서 드롭되지 않도록 무손실로 유지됩니다.

Leaf-spine Clos · ~3:1 · 무손실 RDMA · NVMe-oF / NFS
Plane 3

Front-end 패브릭

테넌트 접근, 추론 서빙, 그리고 나머지 데이터센터 및 인터넷으로 나가는 경로를 위한 북-남 플레인입니다. 400G 또는 800G 접근을 실행하며, back-end 플레인의 collective 패턴이 아니라 자체가 전달하는 서비스 트래픽에 맞춰 사이징됩니다.

북-남 · 테넌트 / 추론 · 400G / 800G
Plane 4

대역 외 관리

자체 회선에 별도의 Clos 또는 MLAG 플레인을 두어, 브링업과 모니터링이 데이터 플레인과 운명을 공유하지 않도록 합니다. ZTP, SNMP, syslog, gNMI/OpenConfig 스트리밍 텔레메트리를 전달하며, 데이터 플레인 패브릭이 재구성되는 동안에도 계속 동작합니다.

격리된 플레인 · ZTP · SNMP / syslog · gNMI 텔레메트리
참조 아키텍처

하나의 NOS 위의 네 개 패브릭과 DCI

하나의 데이터센터, 네 개의 플레인, 코히어런트 광 트랜시버를 통해 두 번째 사이트로 확장됩니다. AI back-end 플레인은 1:1 논블로킹이며, 스토리지, front-end, 관리는 각각 자체 트래픽이 필요로 하는 비율로 실행됩니다. 모든 플레인이 OcNOS-DC를 실행하고, ZR+ DCI 링크가 외부 트랜스폰더 없이 사이트 간 학습을 확장합니다.

AI data center fabric architecture: four planes plus coherent DCI to a second site A single AI data center shown as four stacked network planes: an AI back-end fabric (1:1 non-blocking, RoCEv2 lossless, DLB), a storage fabric (roughly 3:1, NVMe-oF and NFS), a front-end fabric (400G and 800G north-south), and an isolated out-of-band management plane (ZTP, SNMP, syslog, gNMI telemetry). All four planes run OcNOS-DC. A 400G/800G ZR+ coherent DCI link on the UfiSpace S9321-64EO connects the site to a second data center, with multi-DC training reach commonly under about 30 km on ZR+ and longer on OpenZR+. Bottom band: one NOS across AI back-end, storage, front-end, out-of-band management, and coherent DCI. DATA CENTER A · OcNOS-DC AI back-end 패브릭 GPU collectives · rail-optimized / Clos 1:1 non-blocking · RoCEv2 · DLB 스토리지 패브릭 checkpoints / datasets · lossless RDMA ~3:1 · NVMe-oF / NFS Front-end 패브릭 north-south · tenant / inference 400G / 800G Out-of-band mgmt ZTP · SNMP / syslog · telemetry isolated plane · gNMI 데이터센터 B AI back-end 패브릭 1:1 non-blocking · RoCEv2 Storage + front-end ~3:1 · 400G / 800G Out-of-band mgmt ZR+ DCI 400G / 800G ZR+ COHERENT · S9321-64EO · UNDER ~30 KM ZR+ · OPENZR+ FARTHER (oFEC) ONE NOS · OcNOS-DC · AI BACK-END · STORAGE · FRONT-END · OOB · COHERENT DCI

OcNOS 구성 요소: 플레인별 라우팅 eBGP-unnumbered 언더레이(AI back-end는 순수 Layer 3 eBGP이며, EVPN-VXLAN은 AI 언더레이가 아니라 테넌트 오버레이로 유지), back-end 및 스토리지 플레인에서 RoCEv2 무손실(PFC + ECN, DCBX/LLDP를 갖춘 L3 상 PFC)과 DLB, ZTP 및 gNMI 텔레메트리를 위한 격리된 관리 플레인, 그리고 DCI를 위한 S9321-64EO의 400G/800G ZR+ 코히어런트 광 트랜시버. HCL 등재 Tomahawk 5(Edgecore AIS800-64D, UfiSpace S9321-64E / 64EO) 및 Tomahawk 4(Edgecore AS9736-64D) 하드웨어 기반으로 구축됩니다.

사이트 간 확장

코히어런트 DCI, 외부 트랜스폰더 없음

단일 학습 작업이 하나의 데이터 홀을 넘어서면, 패브릭은 border 포트에서 바로 400G 및 800G ZR+ 코히어런트 플러거블 광 트랜시버로 WAN을 넘어 확장됩니다.

The UfiSpace S9321-64EO 는 DCI를 위해 400G ZR+ 코히어런트 광 트랜시버를 추가하는 Tomahawk 5 플랫폼입니다. 도달 거리는 일반적으로 약 다음 미만입니다 ZR+에서 30 km, oFEC를 사용하는 OpenZR+에서는 더 멀리 도달합니다. 각 사이트가 자체 leaf-spine 패브릭을 그대로 유지하면서도 collective 지연을 예산 내로 유지할 만큼 충분히 가깝습니다. 다음을 참조하십시오 코히어런트 DCI 광 트랜시버 및 도달 거리 상세는 심층 설명을 참조하십시오.

The silicon

각 플레인을 실행하는 하드웨어

모든 플레인이 Broadcom Tomahawk 실리콘에서 OcNOS-DC를 실행합니다. 800G 플레인과 DCI는 Tomahawk 5를, 엔트리 및 400G 플레인은 Tomahawk 4를 사용합니다. 둘 다 on-chip 공유 버퍼 스위치이며, 모든 플랫폼이 OcNOS Hardware Compatibility List에 등재되어 있습니다.

실리콘 계층 Tomahawk 5800G 플레인 + DCI Tomahawk 4엔트리 + 400G 플레인
Broadcom 부품BCM78900BCM56990
스위치 용량51.2 Tbps25.6 Tbps
포트 구성64×800G64×400G
버퍼On-chip 공유 버퍼. HCL 등재.On-chip 공유 버퍼. HCL 등재.
플랫폼Edgecore AIS800-64D, UfiSpace S9321-64E. S9321-64EO는 DCI를 위해 400G ZR+ 코히어런트 광 트랜시버를 추가합니다.Edgecore AS9736-64D.
설계에서의 역할800G의 AI back-end 및 스토리지 플레인, 그리고 사이트 간 코히어런트 DCI.엔트리 구축과 400G front-end 또는 관리 플레인.
하나의 NOS, 네 개의 역할

하나의 NOS의 힘

네 개의 플레인과 DCI 링크는 네 개의 제품이 아닙니다. 네 개의 역할을 하는 하나의 운영체제입니다. OcNOS-DC는 하나의 구성 모델과 gNMI 및 OpenConfig 위의 하나의 텔레메트리 스택으로 AI back-end, 스토리지, front-end, 대역 외 관리 패브릭과 코히어런트 DCI를 운영합니다. 팀은 모든 플레인에 대해 하나의 CLI, 하나의 자동화 인터페이스, 하나의 카운터 집합을 익힙니다.

하나의 운영 모델

포트가 GPU 대면 back-end leaf이든, 스토리지 leaf이든, front-end border이든, 관리 스위치이든 동일한 라우팅, QoS, 텔레메트리 모델이 적용됩니다.

하나의 지원 계약

하나의 IP Infusion 계약이 소프트웨어와 검증된 하드웨어를 포괄하며, 모든 플레인에 걸쳐 하나의 TAC와 하나의 SLA를 제공합니다. NOS 벤더와 하드웨어 벤더 간의 책임 전가가 없습니다.

하나의 하드웨어 목록

모든 플레인이 동일한 OcNOS Hardware Compatibility List에서 구축되므로, 지원, 광 트랜시버, 펌웨어가 설계 전반에 걸쳐 일관성을 유지합니다.

성장해 나갈 하나의 로드맵

로드맵에는 패브릭 전체 GLB(OcNOS 7.1), 지연 기반 ECN(7.1.0), 그리고 LLR, CBFS, 패킷 트리밍이 있습니다. 예정된 Tomahawk 6 실리콘(BCM78910 / BCM78914, 102.4 Tbps, TSMC 3nm)은 OcNOS 7.2 트레인을 타고 더 높은 radix에서 동일한 설계를 확장합니다. 첫날부터 텔레메트리 플레인을 구축하여 이러한 기능이 소프트웨어 단계로 도착하도록 하십시오.

자주 묻는 질문

AI 패브릭 아키텍처 FAQ

AI 데이터센터를 구성하는 패브릭은 무엇입니까?
AI 데이터센터는 네 개의 네트워크 플레인을 운영합니다. AI back-end 패브릭 는 GPU 대 GPU collective 트래픽을 전달하며, 논블로킹이고 무손실이어야 하는 플레인입니다. 스토리지 패브릭 은 RDMA를 통해 GPU 랙과 체크포인트 및 데이터셋을 주고받습니다. front-end 패브릭 은 북-남, 테넌트, 추론 접근을 처리합니다. 별도의 대역 외 관리 플레인이 자체 회선에서 스위치를 구동하고 텔레메트리를 스트리밍합니다. 코히어런트 DCI가 설계를 사이트 간으로 확장합니다. OcNOS-DC는 네 개의 플레인 모두와 DCI를 운영합니다.
각 패브릭은 어떤 오버서브스크립션을 사용해야 합니까?
AI back-end 패브릭은 다음이어야 합니다 1:1 논블로킹 GPU 플레인에서, 그곳의 혼잡한 링크가 전체 collective를 정체시키고 모든 GPU가 가장 느린 전송을 기다리기 때문입니다. 스토리지 패브릭은 일반적으로 다음 근처의 비용 최적화 비율로 실행됩니다 3:1, 스토리지 버스트는 collective보다 지연에 덜 민감하기 때문입니다. front-end 및 대역 외 관리 플레인은 더 가볍고 덜 폭발적인 트래픽을 전달하며 더 높은 오버서브스크립션을 허용합니다. 각 플레인이 실제로 전달하는 트래픽에 비율을 맞추십시오.
두 AI 데이터센터를 어떻게 연결합니까?
코히어런트 DCI를 사용하십시오. border 포트의 400G 및 800G ZR+ 플러거블 광 트랜시버로, 외부 트랜스폰더가 없습니다. OcNOS-DC에서 UfiSpace S9321-64EO 가 바로 이를 위해 400G ZR+ 코히어런트 광 트랜시버를 추가합니다. 다중 DC 학습 도달 거리는 일반적으로 약 다음 미만입니다 ZR+에서 30 km, oFEC를 사용하는 OpenZR+에서는 더 멀리 도달합니다. 이를 통해 단일 학습 작업이 두 개 이상의 데이터 홀에 걸치면서도 각 사이트가 자체 leaf-spine 패브릭을 그대로 유지할 수 있습니다.
하나의 NOS가 모든 패브릭을 운영할 수 있습니까?
Yes. OcNOS-DC 가 AI back-end, 스토리지, front-end, 대역 외 관리 플레인과 코히어런트 DCI를 동일한 운영체제에서 운영합니다. 이는 하나의 구성 모델, gNMI 및 OpenConfig 위의 하나의 텔레메트리 스택, 그리고 다음을 의미합니다 하나의 IP Infusion 지원 계약 이 소프트웨어와 검증된 하드웨어를 포괄하며, 설계의 모든 플레인에 걸쳐 하나의 TAC와 하나의 SLA를 제공합니다.
각 플레인을 실행하는 하드웨어는 무엇입니까?
네 개의 플레인 모두 Broadcom Tomahawk 실리콘에서 OcNOS-DC를 실행합니다. 800G 플레인은 다음을 사용합니다 Tomahawk 5 (BCM78900, 51.2 Tbps, 64×800G): Edgecore AIS800-64D 또는 UfiSpace S9321-64E이며, S9321-64EO는 DCI를 위해 400G ZR+ 코히어런트 광 트랜시버를 추가합니다. 엔트리 및 400G 플레인은 다음을 사용합니다 Tomahawk 4 (BCM56990, 25.6 Tbps, 64×400G), 예를 들어 Edgecore AS9736-64D입니다. 이들은 on-chip 공유 버퍼 스위치이며, 모두 OcNOS Hardware Compatibility List에 등재되어 있습니다.

전체 AI 데이터센터를 설계 중이신가요? 모든 플레인을 함께 계획해 드립니다.

GPU 규모와 워크로드를 알려주시면 IP Infusion 엔지니어가 함께 back-end, 스토리지, front-end, 관리, DCI 플레인을 사이징해 드리며, AI Fabric Design Suite에서 1차 레이아웃으로 시작하실 수도 있습니다.