네오클라우드를 위한 네트워킹: AI 학습과 추론을 하나의 패브릭으로
네오클라우드는 학습과 추론을 동일한 인프라에서 실행합니다. IP Infusion은 이 두 가지를 위한 개방형 네트워크를 제공합니다: 검증된 개방형 하드웨어에서 실행되는 OcNOS, GPU 클러스터를 위한 무손실 RoCEv2, 엣지에서의 분산 추론, 사이트 간 개방형 트랜스포트를 하나의 컨트롤 플레인과 하나의 지원 계약으로 제공합니다.
학습과 추론은 네트워크를 서로 반대 방향으로 끌어당깁니다
모든 네오클라우드는 두 가지를 모두 처리합니다. 학습은 소수의 대규모 클러스터를 안정적이고 동기화된 트래픽으로 채웁니다. 추론은 여러 사이트에 분산되며 예고 없이 급증합니다. 패브릭은 두 가지 모두를 감당해야 하며, 그렇지 못하면 수익을 내는 워크로드는 다른 곳으로 떠납니다.
| 네트워크가 마주하는 것 | 학습AI 팩토리 | 추론실시간 서비스 |
|---|---|---|
| 배치 범위 | 소수의 대규모 GPU 클러스터 | 여러 지역 및 엣지 사이트 |
| 트래픽 | 대용량의 동기화된 GPU 간 컬렉티브 통신 | 지연에 민감한 작은 요청 |
| 부하 프로파일 | 장시간에 걸친 지속적이고 거의 최대에 가까운 GPU 사용률 | 버스트성이고 탄력적이며 수 초 만에 급증 |
| 네트워크가 갖춰야 할 것 | 지속적인 대역폭에서도 무손실 | 저지연이며 모든 계층에서 이중화 |
| 장애 허용도 | 허용적이며 작업이 체크포인트를 저장하고 재개 | 낮음, 모든 요청에 엄격한 SLA |
패브릭은 하나인가, 둘인가?
모든 네오클라우드는 같은 질문에 답합니다. 학습과 추론을 감당하기 위해 몇 개의 네트워크를 구축하는가? 그 답이 구축 기간 전체의 비용 구조를 결정합니다.
학습용 네트워크에 추론용 네트워크를 하나 더
학습용 패브릭 하나에 추론용 패브릭을 따로 덧붙입니다. 설계 두 개, 예비 부품 재고 두 개, 운영 팀 두 개, 업그레이드 주기 두 개. 첫 고객이 오기도 전에 자본 비용과 운영 비용이 두 배가 되고, 그 모두를 수익률이 흡수해야 합니다.
하나의 컨트롤 플레인에서 학습과 추론을
두 워크로드 모두 동일한 OcNOS 네트워크에서 실행됩니다. 하나의 이미지, 하나의 컨트롤 플레인, 하나의 지원 계약. 학습 패브릭과 분산 추론 사이트는 동일한 플랫폼으로, 역할별로 규모를 산정하고 라이선스를 부여합니다. 따라서 사업자는 이미 보유한 인프라에서 학습과 그 뒤를 잇는 모든 추론 워크로드를 확보합니다.

GPU 클러스터를 위한 무손실 이더넷 패브릭
학습은 GPU 사이에 대량의 동기화된 트래픽을 이동시키므로 패브릭은 부하 상태에서도 무손실을 유지해야 합니다. OcNOS는 개방형 머천트 실리콘에서 RoCEv2 툴킷을 최대 800G로 실행하여, AI 팩토리는 단일 벤더 스택 없이 고래딕스 이더넷 패브릭을 얻습니다.
무손실 RoCEv2
Priority flow control, ECN, and DCQCN 는 GPU 컬렉티브 트래픽을 패킷 손실로부터 보호하고, 적응형 로드 밸런싱으로 패브릭 전체에 분산합니다.
개방형 실리콘에서 최대 800G
고래딕스 이더넷을 검증된 개방형 하드웨어 여러 벤더의 하드웨어가 학습 패브릭을 담당하며, 클러스터를 확장할 여유를 남깁니다.
GPU 스택에 대응
패브릭은 GPU collective libraries (NCCL, RCCL, oneCCL) 위에서 학습 작업이 실행되므로, AllReduce에서 네트워크가 병목이 되지 않습니다.
동일한 OcNOS 이미지가 모든 단계에서 동작하므로, 패브릭은 각 단계마다 다시 설계되지 않고 클러스터와 함께 확장됩니다.
추론은 엣지에 존재하며, 네트워크가 이를 따라와야 합니다
추론은 여러 지역 및 엣지 사이트에 분산되고, 빠르게 확장·축소되며, 엄격한 지연 목표를 유지합니다. 이 지점에서 네오클라우드는 데이터센터 패브릭 이상을 필요로 합니다. 사이트 간 트랜스포트와 모든 사이트에 걸친 어슈어런스입니다. IP Infusion은 전체 경로를 포괄합니다.
각 사이트의 데이터센터 패브릭
An EVPN-VXLAN 리프-스파인 패브릭이 개방형 스위치에서 각 추론 사이트를 담당하며, 수요 변화에 따라 용량을 추가·제거하는 탄력성을 갖춥니다.
사이트 간 개방형 트랜스포트
저지연 트랜스포트가 사이트들을 하나로 묶습니다. IP over DWDM with coherent ZR and ZR+ 는 광 계층을 라우터에 통합하여 사이트 간 용량을 제공합니다.
모든 사이트에 걸친 어슈어런스
IP Maestro 는 전체 인프라를 하나의 뷰로 보여주어, 사업자가 여러 사이트와 N+1 설계에 걸쳐 추론 서비스 수준을 유지하도록 합니다.
네오클라우드가 지켜낼 수 있는 비용 구조
네오클라우드는 가격과 확장 속도로 경쟁하므로, 네트워크가 독점적 세금이 되어서는 안 됩니다. 오픈 네트워킹은 하드웨어, 소프트웨어, 리드 타임의 주도권을 사업자에게 주며, 소프트웨어와 지원은 여전히 한 벤더가 책임집니다.
멀티벤더 공급망
Switches from Edgecore, UfiSpace 등의 스위치는 동일한 OcNOS 이미지를 실행하므로, 사업자는 하드웨어나 리드 타임에서 특정 벤더에 종속되지 않습니다.
낮은 하드웨어 비용
개방형 머천트 실리콘 스위치의 OcNOS는 AI 패브릭을 40~60% 낮은 하드웨어 비용으로 포트 속도와 radix가 동등한 독점 플랫폼보다 낮춰 담당합니다.
한 벤더가 해결을 책임집니다
하드웨어와 소프트웨어는 독립적인 주기로 갱신되지만, 하나의 지원 계약이 전체 시스템을 포괄하므로, 하나의 팀이 해결을 책임집니다.
개방형 네트워크는 이미 대규모로 운영되고 있습니다
네오클라우드 패브릭은 실험실 과제가 아닙니다. 전 세계 사업자의 프로덕션 트래픽을 나르는 것과 동일한 OcNOS를, 동일한 개방형 하드웨어에서 실행합니다.
네오클라우드 네트워킹, 자주 묻는 질문
네오클라우드란?
네오클라우드는 InfiniBand를 쓰나요, Ethernet을 쓰나요?
네오클라우드는 학습과 추론을 위해 네트워크를 하나 지어야 하나요, 둘 지어야 하나요?
네오클라우드에 여전히 두 개의 분리된 네트워크가 필요한 경우는?
분산 추론은 네트워크에 무엇을 요구하나요?
오픈 네트워킹은 어떻게 네오클라우드 비용을 낮추나요?
OcNOS-DC 데이터시트를 받아 가세요
이 페이지보다 더 깊이 들어가는 짧은 기술 자료: OcNOS-DC 전체 데이터시트입니다.
OcNOS-DC 데이터시트
간단한 양식입니다. 제출하면 PDF가 즉시 새 탭에서 열립니다.
✓ 새 탭에서 PDF를 여는 중입니다…
열리지 않았다면 아래 링크를 이용해 주십시오.
하나의 컨트롤 플레인으로 네오클라우드 패브릭을 설계하세요
GPU 규모와 서비스하려는 사이트를 알려주시면, IP Infusion 엔지니어가 학습과 추론을 위한 하나의 개방형 패브릭 설계를 도와드립니다.
저희가 연락드릴까요?
연락처를 남겨 주시면 IP Infusion 엔지니어가 AI 학습과 추론을 위한 하나의 개방형 패브릭 설계를 도와드립니다. 원하시는 경우에만 연락드립니다.