Neocloud · AI training and inference

面向 neocloud 的網路:用一張 fabric 承載 AI 訓練與推論

neocloud 在同一套基礎設施上執行訓練與推論。IP Infusion 為兩者提供開放網路: 執行在經過驗證的開放硬體上的 OcNOS,為 GPU 叢集提供無損 RoCEv2、在邊緣進行分散式推理、在站點之間提供開放傳輸,全部由一個控制平面與一份支援合約交付。

1 張 fabric訓練與推論
最高 800G乙太網路 AI fabric
40% 到 60%更低的硬體成本
600+營運商網路
兩種工作負載,一門生意

訓練與推論把網路拉向相反的方向

每個 neocloud 都要同時服務兩者。訓練用穩定、同步的流量填滿少數幾個大型叢集。推理則分散在眾多站點並會毫無預警地激增。fabric 必須同時兼顧兩者,否則那些能帶來收入的工作負載就會轉向他處。

訓練與推論對比,依決定 fabric 的網路指標逐項列出。
網路所面對的 訓練AI 工廠 推論即時服務
分布少數幾個大型 GPU 叢集眾多區域與邊緣站點
流量大批量、同步的 GPU 到 GPU 集合通訊小而對延遲敏感的請求
負載特徵長時間保持接近滿載的 GPU 使用率突發且彈性,數秒內激增
網路必須做到在持續頻寬下保持無損低延遲,且每一層都備援
故障容忍度容忍度高,作業可做檢查點並恢復低,每個請求都有嚴格 SLA
決定你利潤率的網路抉擇

一張 fabric,還是兩張?

每個 neocloud 都要回答同一個問題:為承載訓練與推論,它要建幾張網路?答案決定了整個建設週期的成本基礎。

Option A · two networks

一張訓練網路,再加一張用於推理

一張 fabric 用於訓練,再另外拼上一張用於推理。兩套設計、兩套備件、兩個維運團隊、兩套升級週期。在第一個客戶到來之前,資本與營運成本就已翻倍,而這一切都要由利潤去消化。

資本與營運支出翻倍,利潤承壓
Option B · one OcNOS fabric

訓練與推論執行在一個控制平面上

兩種工作負載都執行在同一張 OcNOS 網路上。 一個映像、一個控制平面、一份支援合約。 訓練 fabric 與分散式推理站點是同一個平台,依角色進行規格設計與授權,因此營運商可以在自己已有的基礎設施上,承接訓練以及隨之而來的每一個推理工作負載。

一張 fabric,成本隨業務擴展
面向 neocloud 的一張 OcNOS fabric:左側是以最高 800G 執行無損 RoCEv2 的 leaf-spine GPU 訓練叢集,右側是分散式推理站點,透過開放的 IP over DWDM 傳輸相連,全部處於一個 OcNOS 控制平面之下。
一張用於訓練與推論的 OcNOS fabric:無損 RoCEv2 的 GPU 訓練叢集、分散式推理站點,以及它們之間的開放傳輸,全部在一個控制平面之下。
訓練 fabric

面向 GPU 叢集的無損乙太網路 fabric

訓練在 GPU 之間搬運大批量、同步的流量,因此 fabric 在負載下必須保持無損。OcNOS 在開放的商用晶片上以最高 800G 執行 RoCEv2 工具集,讓 AI 工廠無需單一廠商的技術堆疊即可獲得高基數乙太網路 fabric。

無損 RoCEv2

Priority flow control, ECN, and DCQCN 讓 GPU 集合通訊流量避免丟包,並透過自適應負載平衡將其分散到整個 fabric。

在開放晶片上最高 800G

高基數乙太網路,執行在 經過驗證的開放硬體 多家廠商的硬體之上,承載訓練 fabric,並留有橫向擴展叢集的餘量。

為 GPU 技術堆疊就緒

fabric 承載 GPU collective libraries (NCCL, RCCL, oneCCL) 訓練作業在其上執行,因此網路不會成為 AllReduce 的瓶頸。

一套映像,涵蓋每一個規模層級
機架
GPU 伺服器 + leaf
你擴容的基本單位:置於架頂(ToR)leaf 之後的 GPU 伺服器。
Pod
Leaf-spine 模組
無阻塞的 leaf-spine 模組,是 fabric 可複製的建構單元。
叢集
最多 4,096 個 GPU
執行在一張無損 RoCEv2 fabric 上的完整訓練叢集。
多叢集
16,384 個 GPU 的設計
多個叢集加上分散式推論站點,統一在一個控制平面下。

同一套 OcNOS 映像執行於每一個層級,因此 fabric 隨叢集一起橫向擴展,而不必在每一步重新設計。

分散式推理

推理位於邊緣,需要網路跟得上

推理分散在眾多區域與邊緣站點,能快速伸縮,並要守住嚴格的延遲目標。在這裡,neocloud 需要的不只是資料中心 fabric:它需要站點之間的傳輸,以及貫穿所有站點的保障。IP Infusion 涵蓋整條路徑。

每個站點的資料中心 fabric

An EVPN-VXLAN leaf-spine fabric 執行在開放交換器上,服務每個推理站點,並具備隨需求增減容量的彈性。

站點之間的開放傳輸

低延遲傳輸將各站點連接起來。 IP over DWDM with coherent ZR and ZR+ 將光層收斂到路由器上,提供站點間的容量。

貫穿每個站點的保障

IP Maestro 提供對整個部署的統一檢視,讓營運商能在眾多站點與 N+1 設計中守住推理的服務水準。

開放硬體,更低成本

neocloud 守得住的成本基礎

neocloud 靠價格與擴展速度競爭,因此網路不能成為一種專有稅。開放網路讓營運商掌控硬體、軟體與交付週期,同時仍由一家廠商負責軟體與支援。

多廠商供應鏈

Switches from Edgecore、UfiSpace 等廠商的交換器 執行同一個 OcNOS 映像,因此營運商在硬體或交付週期上從不被單一廠商綁定。

更低的硬體成本

執行在開放商用晶片交換器上的 OcNOS 承載 AI fabric,成本 降低 40% 到 60% ,在相當的埠速率與 radix 下低於專有平台。

由一家廠商負責修復

硬體與軟體按各自獨立的週期更新,但 一份支援合約 涵蓋整個系統,因此由一個團隊負責修復。

已在生產環境中驗證

這張開放網路已經在大規模運行

neocloud fabric 不是實驗室裡的演練。它執行的是與全球營運商承載生產流量相同的 OcNOS,跑在相同的開放硬體上。

600+
家營運商網路在服務供應商、資料中心與網際網路交換中心運行 OcNOS。
60+
個國家中,OcNOS 如今承載著即時生產流量。
40+
個以上經過驗證的開放硬體平台從同一個映像執行 OcNOS。
常見問題

neocloud 網路問答

什麼是 neocloud?
neocloud 是一種以 AI 為先的雲端服務商,圍繞用於訓練與推理的高密度 GPU 算力構建,而非傳統超大規模雲的通用服務。neocloud 靠加速器的原始效能、擴展速度與成本競爭,因此承載 GPU 流量的網路是其經濟性的核心,而非事後考量。
neocloud 用 InfiniBand 還是乙太網路?
兩者都有部署,而隨著 800G 的到來,產業正走向乙太網路。基於 RoCEv2 的乙太網路在開放的商用晶片上承載 GPU 集合通訊流量,因此 neocloud 無需單一廠商技術堆疊即可獲得無損 AI fabric。OcNOS 在經過驗證的開放硬體上執行完整的 RoCEv2 工具集,包括 priority flow control、ECN 與自適應負載平衡。
neocloud 該為訓練與推論建一張網路還是兩張?
訓練與推理是相反的工作負載:訓練集中且吃頻寬,推理分散、突發且對延遲敏感。建兩張獨立網路會讓資本與營運成本翻倍。把兩者放在一張 OcNOS fabric、一個控制平面上執行,能讓 neocloud 用同一套基礎設施承載訓練和每一個推理工作負載,營運利潤率正是在這裡得到改善。
neocloud 何時仍然需要兩張獨立的網路?
有些營運商會刻意分離訓練與推論,而且理由充分:租戶之間的嚴格隔離、不同團隊各自的維運域、明確的效能邊界,或已經承載訓練的現有 InfiniBand 孤島。OcNOS 兩種方式都能執行。關鍵在於,分離應當是刻意為之的設計選擇,而不是架構強加給你的成本。當同一個團隊能夠在一個控制平面上執行這兩種工作負載時,依角色規劃並授權的一張 fabric,才是守住利潤率的預設選擇。
分散式推理對網路有什麼要求?
推理分散在眾多區域與邊緣站點,能快速伸縮,並要守住嚴格的延遲目標,因此網路需要彈性容量、每一層的備援,以及站點之間的低延遲傳輸。IP Infusion 涵蓋整條路徑:資料中心 fabric、站點之間的傳輸與 IP over DWDM,以及用於保障的 IP Maestro。
開放網路如何降低 neocloud 的成本?
neocloud 從多廠商供應鏈按各自獨立的週期採購交換器與軟體,因此在硬體、軟體或交付週期上都不被單一廠商綁定。執行在開放商用晶片交換器上的 OcNOS,以低於專有平台的硬體成本承載 AI fabric,而軟體與支援仍由一家廠商在一份合約下負責。

用一個控制平面設計你的 neocloud fabric

告訴我們你的 GPU 規模與計畫服務的站點,IP Infusion 工程師將協助你設計一張用於訓練與推論的開放 fabric。