Neocloud · AI training and inference

네오클라우드를 위한 네트워킹: AI 학습과 추론을 하나의 패브릭으로

네오클라우드는 학습과 추론을 동일한 인프라에서 실행합니다. IP Infusion은 이 두 가지를 위한 개방형 네트워크를 제공합니다: 검증된 개방형 하드웨어에서 실행되는 OcNOS, GPU 클러스터를 위한 무손실 RoCEv2, 엣지에서의 분산 추론, 사이트 간 개방형 트랜스포트를 하나의 컨트롤 플레인과 하나의 지원 계약으로 제공합니다.

1개 패브릭학습과 추론
최대 800G이더넷 AI 패브릭
40~60%낮은 하드웨어 비용
600+사업자 네트워크
두 가지 워크로드, 하나의 비즈니스

학습과 추론은 네트워크를 서로 반대 방향으로 끌어당깁니다

모든 네오클라우드는 두 가지를 모두 처리합니다. 학습은 소수의 대규모 클러스터를 안정적이고 동기화된 트래픽으로 채웁니다. 추론은 여러 사이트에 분산되며 예고 없이 급증합니다. 패브릭은 두 가지 모두를 감당해야 하며, 그렇지 못하면 수익을 내는 워크로드는 다른 곳으로 떠납니다.

학습과 추론 비교. 패브릭을 좌우하는 네트워크 지표별로 정리했습니다.
네트워크가 마주하는 것 학습AI 팩토리 추론실시간 서비스
배치 범위소수의 대규모 GPU 클러스터여러 지역 및 엣지 사이트
트래픽대용량의 동기화된 GPU 간 컬렉티브 통신지연에 민감한 작은 요청
부하 프로파일장시간에 걸친 지속적이고 거의 최대에 가까운 GPU 사용률버스트성이고 탄력적이며 수 초 만에 급증
네트워크가 갖춰야 할 것지속적인 대역폭에서도 무손실저지연이며 모든 계층에서 이중화
장애 허용도허용적이며 작업이 체크포인트를 저장하고 재개낮음, 모든 요청에 엄격한 SLA
수익률을 좌우하는 네트워크 결정

패브릭은 하나인가, 둘인가?

모든 네오클라우드는 같은 질문에 답합니다. 학습과 추론을 감당하기 위해 몇 개의 네트워크를 구축하는가? 그 답이 구축 기간 전체의 비용 구조를 결정합니다.

Option A · two networks

학습용 네트워크에 추론용 네트워크를 하나 더

학습용 패브릭 하나에 추론용 패브릭을 따로 덧붙입니다. 설계 두 개, 예비 부품 재고 두 개, 운영 팀 두 개, 업그레이드 주기 두 개. 첫 고객이 오기도 전에 자본 비용과 운영 비용이 두 배가 되고, 그 모두를 수익률이 흡수해야 합니다.

자본 비용과 운영 비용 중복, 수익률 압박
Option B · one OcNOS fabric

하나의 컨트롤 플레인에서 학습과 추론을

두 워크로드 모두 동일한 OcNOS 네트워크에서 실행됩니다. 하나의 이미지, 하나의 컨트롤 플레인, 하나의 지원 계약. 학습 패브릭과 분산 추론 사이트는 동일한 플랫폼으로, 역할별로 규모를 산정하고 라이선스를 부여합니다. 따라서 사업자는 이미 보유한 인프라에서 학습과 그 뒤를 잇는 모든 추론 워크로드를 확보합니다.

하나의 패브릭, 비즈니스에 따라 확장되는 비용
네오클라우드를 위한 하나의 OcNOS 패브릭: 왼쪽은 최대 800G의 무손실 RoCEv2로 동작하는 leaf-spine GPU 학습 클러스터, 오른쪽은 분산 추론 사이트로, 개방형 IP over DWDM 트랜스포트로 연결되며 모두 하나의 OcNOS 컨트롤 플레인 아래에 있습니다.
학습과 추론을 위한 하나의 OcNOS 패브릭: 무손실 RoCEv2 GPU 학습 클러스터, 분산 추론 사이트, 그리고 이들을 잇는 개방형 트랜스포트를 하나의 컨트롤 플레인 아래에.
학습 패브릭

GPU 클러스터를 위한 무손실 이더넷 패브릭

학습은 GPU 사이에 대량의 동기화된 트래픽을 이동시키므로 패브릭은 부하 상태에서도 무손실을 유지해야 합니다. OcNOS는 개방형 머천트 실리콘에서 RoCEv2 툴킷을 최대 800G로 실행하여, AI 팩토리는 단일 벤더 스택 없이 고래딕스 이더넷 패브릭을 얻습니다.

무손실 RoCEv2

Priority flow control, ECN, and DCQCN 는 GPU 컬렉티브 트래픽을 패킷 손실로부터 보호하고, 적응형 로드 밸런싱으로 패브릭 전체에 분산합니다.

개방형 실리콘에서 최대 800G

고래딕스 이더넷을 검증된 개방형 하드웨어 여러 벤더의 하드웨어가 학습 패브릭을 담당하며, 클러스터를 확장할 여유를 남깁니다.

GPU 스택에 대응

패브릭은 GPU collective libraries (NCCL, RCCL, oneCCL) 위에서 학습 작업이 실행되므로, AllReduce에서 네트워크가 병목이 되지 않습니다.

하나의 이미지로 모든 확장 단계에
GPU 서버 + Leaf
용량을 추가하는 단위입니다. 톱오브랙 Leaf 뒤에 GPU 서버를 둡니다.
Pod
Leaf-Spine 블록
논블로킹 Leaf-Spine 블록으로, 패브릭의 반복 가능한 구성 단위입니다.
클러스터
최대 4,096개 GPU
하나의 무손실 RoCEv2 패브릭 위의 완전한 학습 클러스터.
멀티클러스터
16,384개 GPU 설계
여러 클러스터와 분산 추론 사이트를 하나의 컨트롤 플레인으로.

동일한 OcNOS 이미지가 모든 단계에서 동작하므로, 패브릭은 각 단계마다 다시 설계되지 않고 클러스터와 함께 확장됩니다.

분산 추론

추론은 엣지에 존재하며, 네트워크가 이를 따라와야 합니다

추론은 여러 지역 및 엣지 사이트에 분산되고, 빠르게 확장·축소되며, 엄격한 지연 목표를 유지합니다. 이 지점에서 네오클라우드는 데이터센터 패브릭 이상을 필요로 합니다. 사이트 간 트랜스포트와 모든 사이트에 걸친 어슈어런스입니다. IP Infusion은 전체 경로를 포괄합니다.

각 사이트의 데이터센터 패브릭

An EVPN-VXLAN 리프-스파인 패브릭이 개방형 스위치에서 각 추론 사이트를 담당하며, 수요 변화에 따라 용량을 추가·제거하는 탄력성을 갖춥니다.

사이트 간 개방형 트랜스포트

저지연 트랜스포트가 사이트들을 하나로 묶습니다. IP over DWDM with coherent ZR and ZR+ 는 광 계층을 라우터에 통합하여 사이트 간 용량을 제공합니다.

모든 사이트에 걸친 어슈어런스

IP Maestro 는 전체 인프라를 하나의 뷰로 보여주어, 사업자가 여러 사이트와 N+1 설계에 걸쳐 추론 서비스 수준을 유지하도록 합니다.

개방형 하드웨어, 낮은 비용

네오클라우드가 지켜낼 수 있는 비용 구조

네오클라우드는 가격과 확장 속도로 경쟁하므로, 네트워크가 독점적 세금이 되어서는 안 됩니다. 오픈 네트워킹은 하드웨어, 소프트웨어, 리드 타임의 주도권을 사업자에게 주며, 소프트웨어와 지원은 여전히 한 벤더가 책임집니다.

멀티벤더 공급망

Switches from Edgecore, UfiSpace 등의 스위치는 동일한 OcNOS 이미지를 실행하므로, 사업자는 하드웨어나 리드 타임에서 특정 벤더에 종속되지 않습니다.

낮은 하드웨어 비용

개방형 머천트 실리콘 스위치의 OcNOS는 AI 패브릭을 40~60% 낮은 하드웨어 비용으로 포트 속도와 radix가 동등한 독점 플랫폼보다 낮춰 담당합니다.

한 벤더가 해결을 책임집니다

하드웨어와 소프트웨어는 독립적인 주기로 갱신되지만, 하나의 지원 계약이 전체 시스템을 포괄하므로, 하나의 팀이 해결을 책임집니다.

프로덕션에서 입증됨

개방형 네트워크는 이미 대규모로 운영되고 있습니다

네오클라우드 패브릭은 실험실 과제가 아닙니다. 전 세계 사업자의 프로덕션 트래픽을 나르는 것과 동일한 OcNOS를, 동일한 개방형 하드웨어에서 실행합니다.

600+
개 사업자 네트워크가 서비스 프로바이더, 데이터센터, 인터넷 익스체인지에서 OcNOS를 운영합니다.
60+
개국에서 OcNOS가 오늘도 실제 프로덕션 트래픽을 나릅니다.
40+
개 이상의 검증된 개방형 하드웨어 플랫폼이 하나의 이미지로 OcNOS를 실행합니다.
자주 묻는 질문

네오클라우드 네트워킹, 자주 묻는 질문

네오클라우드란?
네오클라우드는 전통적인 하이퍼스케일러의 범용 서비스가 아니라, 학습과 추론을 위한 고밀도 GPU 컴퓨트를 중심으로 구축된 AI 우선 클라우드 사업자입니다. 네오클라우드는 가속기의 순수 성능, 빠른 확장, 비용으로 경쟁하므로 GPU 트래픽을 나르는 네트워크는 경제성의 핵심이며 부차적인 요소가 아닙니다.
네오클라우드는 InfiniBand를 쓰나요, Ethernet을 쓰나요?
둘 다 사용되며, 800G가 본격화되면서 업계는 Ethernet 쪽으로 향하고 있습니다. RoCEv2를 사용하는 Ethernet은 개방형 머천트 실리콘에서 GPU 컬렉티브 트래픽을 나르므로, 네오클라우드는 단일 벤더 스택 없이 무손실 AI 패브릭을 얻습니다. OcNOS는 Priority Flow Control, ECN, 적응형 로드 밸런싱을 포함한 RoCEv2 툴킷 전체를 검증된 개방형 하드웨어에서 실행합니다.
네오클라우드는 학습과 추론을 위해 네트워크를 하나 지어야 하나요, 둘 지어야 하나요?
학습과 추론은 상반된 워크로드입니다. 학습은 집중형이고 대역폭을 많이 쓰며, 추론은 분산형이고 버스트성이며 지연에 민감합니다. 두 개의 별도 네트워크를 구축하면 자본 비용과 운영 비용이 중복됩니다. 두 가지를 하나의 OcNOS 패브릭과 하나의 컨트롤 플레인에서 실행하면, 네오클라우드는 동일한 인프라에서 학습과 모든 추론 워크로드를 제공할 수 있고, 바로 그 지점에서 영업 이익률이 개선됩니다.
네오클라우드에 여전히 두 개의 분리된 네트워크가 필요한 경우는?
일부 사업자는 분명한 이유로 학습과 추론을 의도적으로 분리합니다. 테넌트 간 엄격한 격리, 팀별로 구분된 운영 도메인, 명확한 성능 경계, 또는 이미 학습을 담당하는 기존 InfiniBand 아일랜드 등이 그것입니다. OcNOS는 어느 구성에서도 동작합니다. 핵심은 분리가 아키텍처가 강요하는 비용이 아니라 의도적인 설계 선택이어야 한다는 점입니다. 한 팀이 두 워크로드를 하나의 컨트롤 플레인에서 운영할 수 있다면, 역할별로 사이징하고 라이선스한 하나의 패브릭이 마진을 지키는 기본 선택입니다.
분산 추론은 네트워크에 무엇을 요구하나요?
추론은 여러 지역 및 엣지 사이트에 분산되고, 빠르게 확장·축소되며, 엄격한 지연 목표를 유지하므로 네트워크에는 탄력적 용량, 모든 계층의 이중화, 사이트 간 저지연 트랜스포트가 필요합니다. IP Infusion은 전체 경로를 포괄합니다. 데이터센터 패브릭, 사이트 간 트랜스포트와 IP over DWDM, 그리고 어슈어런스를 위한 IP Maestro입니다.
오픈 네트워킹은 어떻게 네오클라우드 비용을 낮추나요?
네오클라우드는 스위치와 소프트웨어를 멀티벤더 공급망에서 독립적인 주기로 구매하므로, 하드웨어, 소프트웨어, 리드 타임 어느 것에서도 특정 벤더에 종속되지 않습니다. 개방형 머천트 실리콘 스위치의 OcNOS는 독점 플랫폼보다 낮은 하드웨어 비용으로 AI 패브릭을 나르며, 소프트웨어와 지원은 여전히 한 벤더가 하나의 계약으로 책임집니다.
데이터시트

OcNOS-DC 데이터시트를 받아 가세요

이 페이지보다 더 깊이 들어가는 짧은 기술 자료: OcNOS-DC 전체 데이터시트입니다.

하나의 컨트롤 플레인으로 네오클라우드 패브릭을 설계하세요

GPU 규모와 서비스하려는 사이트를 알려주시면, IP Infusion 엔지니어가 학습과 추론을 위한 하나의 개방형 패브릭 설계를 도와드립니다.