面向 neocloud 的網路:用一張 fabric 承載 AI 訓練與推論
neocloud 在同一套基礎設施上執行訓練與推論。IP Infusion 為兩者提供開放網路: 執行在經過驗證的開放硬體上的 OcNOS,為 GPU 叢集提供無損 RoCEv2、在邊緣進行分散式推理、在站點之間提供開放傳輸,全部由一個控制平面與一份支援合約交付。
訓練與推論把網路拉向相反的方向
每個 neocloud 都要同時服務兩者。訓練用穩定、同步的流量填滿少數幾個大型叢集。推理則分散在眾多站點並會毫無預警地激增。fabric 必須同時兼顧兩者,否則那些能帶來收入的工作負載就會轉向他處。
| 網路所面對的 | 訓練AI 工廠 | 推論即時服務 |
|---|---|---|
| 分布 | 少數幾個大型 GPU 叢集 | 眾多區域與邊緣站點 |
| 流量 | 大批量、同步的 GPU 到 GPU 集合通訊 | 小而對延遲敏感的請求 |
| 負載特徵 | 長時間保持接近滿載的 GPU 使用率 | 突發且彈性,數秒內激增 |
| 網路必須做到 | 在持續頻寬下保持無損 | 低延遲,且每一層都備援 |
| 故障容忍度 | 容忍度高,作業可做檢查點並恢復 | 低,每個請求都有嚴格 SLA |
一張 fabric,還是兩張?
每個 neocloud 都要回答同一個問題:為承載訓練與推論,它要建幾張網路?答案決定了整個建設週期的成本基礎。
一張訓練網路,再加一張用於推理
一張 fabric 用於訓練,再另外拼上一張用於推理。兩套設計、兩套備件、兩個維運團隊、兩套升級週期。在第一個客戶到來之前,資本與營運成本就已翻倍,而這一切都要由利潤去消化。
訓練與推論執行在一個控制平面上
兩種工作負載都執行在同一張 OcNOS 網路上。 一個映像、一個控制平面、一份支援合約。 訓練 fabric 與分散式推理站點是同一個平台,依角色進行規格設計與授權,因此營運商可以在自己已有的基礎設施上,承接訓練以及隨之而來的每一個推理工作負載。

面向 GPU 叢集的無損乙太網路 fabric
訓練在 GPU 之間搬運大批量、同步的流量,因此 fabric 在負載下必須保持無損。OcNOS 在開放的商用晶片上以最高 800G 執行 RoCEv2 工具集,讓 AI 工廠無需單一廠商的技術堆疊即可獲得高基數乙太網路 fabric。
無損 RoCEv2
Priority flow control, ECN, and DCQCN 讓 GPU 集合通訊流量避免丟包,並透過自適應負載平衡將其分散到整個 fabric。
為 GPU 技術堆疊就緒
fabric 承載 GPU collective libraries (NCCL, RCCL, oneCCL) 訓練作業在其上執行,因此網路不會成為 AllReduce 的瓶頸。
同一套 OcNOS 映像執行於每一個層級,因此 fabric 隨叢集一起橫向擴展,而不必在每一步重新設計。
推理位於邊緣,需要網路跟得上
推理分散在眾多區域與邊緣站點,能快速伸縮,並要守住嚴格的延遲目標。在這裡,neocloud 需要的不只是資料中心 fabric:它需要站點之間的傳輸,以及貫穿所有站點的保障。IP Infusion 涵蓋整條路徑。
neocloud 守得住的成本基礎
neocloud 靠價格與擴展速度競爭,因此網路不能成為一種專有稅。開放網路讓營運商掌控硬體、軟體與交付週期,同時仍由一家廠商負責軟體與支援。
這張開放網路已經在大規模運行
neocloud fabric 不是實驗室裡的演練。它執行的是與全球營運商承載生產流量相同的 OcNOS,跑在相同的開放硬體上。
neocloud 網路問答
什麼是 neocloud?
neocloud 用 InfiniBand 還是乙太網路?
neocloud 該為訓練與推論建一張網路還是兩張?
neocloud 何時仍然需要兩張獨立的網路?
分散式推理對網路有什麼要求?
開放網路如何降低 neocloud 的成本?
帶走 OcNOS-DC 資料表
一份比本頁更深入的簡短技術下載:完整的 OcNOS-DC 資料表。
用一個控制平面設計你的 neocloud fabric
告訴我們你的 GPU 規模與計畫服務的站點,IP Infusion 工程師將協助你設計一張用於訓練與推論的開放 fabric。
需要我們主動與您聯繫嗎?
留下您的資訊,IP Infusion 工程師將協助您設計一張用於 AI 訓練與推論的開放 fabric。僅在您希望時我們才會與您聯繫。