Neocloud · AI training and inference

面向 neocloud 的网络:用一张 fabric 承载 AI 训练与推理

neocloud 在同一套基础设施上运行训练与推理。IP Infusion 为两者提供开放网络: 运行在经过验证的开放硬件上的 OcNOS,为 GPU 集群提供无损 RoCEv2、在边缘进行分布式推理、在站点之间提供开放传输,全部由一个控制平面和一份支持合同交付。

1 张 fabric训练与推理
最高 800G以太网 AI fabric
40% 到 60%更低的硬件成本
600+运营商网络
两种工作负载,一门生意

训练与推理把网络拉向相反的方向

每个 neocloud 都要同时服务两者。训练用稳定、同步的流量填满少数几个大型集群。推理则分散在众多站点并会毫无预警地激增。fabric 必须同时兼顾两者,否则那些能带来收入的工作负载就会转向别处。

训练与推理对比,按决定 fabric 的网络指标逐项列出。
网络所面对的 训练AI 工厂 推理实时服务
分布少数几个大型 GPU 集群众多区域和边缘站点
流量大批量、同步的 GPU 到 GPU 集合通信小而对时延敏感的请求
负载特征长时间保持接近满载的 GPU 利用率突发且弹性,数秒内激增
网络必须做到在持续带宽下保持无损低时延,且每一层都冗余
故障容忍度容忍度高,作业可做检查点并恢复低,每个请求都有严格 SLA
决定你利润率的网络抉择

一张 fabric,还是两张?

每个 neocloud 都要回答同一个问题:为承载训练与推理,它要建几张网络?答案决定了整个建设周期的成本基础。

Option A · two networks

一张训练网络,再加一张用于推理

一张 fabric 用于训练,再另外拼上一张用于推理。两套设计、两套备件、两个运维团队、两套升级周期。在第一个客户到来之前,资本与运营成本就已翻倍,而这一切都要由利润去消化。

资本与运营支出翻倍,利润承压
Option B · one OcNOS fabric

训练与推理运行在一个控制平面上

两种工作负载都运行在同一张 OcNOS 网络上。 一个镜像、一个控制平面、一份支持合同。 训练 fabric 与分布式推理站点是同一个平台,按角色进行规格设计与授权,因此运营商可以在自己已有的基础设施上,承接训练以及随之而来的每一个推理工作负载。

一张 fabric,成本随业务扩展
面向 neocloud 的一张 OcNOS fabric:左侧是以最高 800G 运行无损 RoCEv2 的 leaf-spine GPU 训练集群,右侧是分布式推理站点,通过开放的 IP over DWDM 传输相连,全部处于一个 OcNOS 控制平面之下。
一张用于训练与推理的 OcNOS fabric:无损 RoCEv2 的 GPU 训练集群、分布式推理站点,以及它们之间的开放传输,全部在一个控制平面之下。
训练 fabric

面向 GPU 集群的无损以太网 fabric

训练在 GPU 之间搬运大批量、同步的流量,因此 fabric 在负载下必须保持无损。OcNOS 在开放的商用芯片上以最高 800G 运行 RoCEv2 工具集,让 AI 工厂无需单一厂商的技术栈即可获得高基数以太网 fabric。

无损 RoCEv2

Priority flow control, ECN, and DCQCN 让 GPU 集合通信流量避免丢包,并通过自适应负载均衡将其分散到整个 fabric。

在开放芯片上最高 800G

高基数以太网,运行在 经过验证的开放硬件 多家厂商的硬件之上,承载训练 fabric,并留有横向扩展集群的余量。

为 GPU 技术栈就绪

fabric 承载 GPU collective libraries (NCCL, RCCL, oneCCL) 训练作业在其上运行,因此网络不会成为 AllReduce 的瓶颈。

一套镜像,覆盖每一个规模层级
机架
GPU 服务器 + leaf
你扩容的基本单位:置于架顶(ToR)leaf 之后的 GPU 服务器。
Pod
Leaf-spine 模块
无阻塞的 leaf-spine 模块,是 fabric 可复制的构建单元。
集群
最多 4,096 个 GPU
运行在一张无损 RoCEv2 fabric 上的完整训练集群。
多集群
16,384 个 GPU 的设计
多个集群加上分布式推理站点,统一在一个控制平面下。

同一套 OcNOS 镜像运行于每一个层级,因此 fabric 随集群一起横向扩展,而不必在每一步重新设计。

分布式推理

推理位于边缘,需要网络跟得上

推理分散在众多区域和边缘站点,能快速伸缩,并要守住严格的时延目标。在这里,neocloud 需要的不只是数据中心 fabric:它需要站点之间的传输,以及贯穿所有站点的保障。IP Infusion 覆盖整条路径。

每个站点的数据中心 fabric

An EVPN-VXLAN leaf-spine fabric 运行在开放交换机上,服务每个推理站点,并具备随需求增减容量的弹性。

站点之间的开放传输

低时延传输将各站点连接起来。 IP over DWDM with coherent ZR and ZR+ 将光层收敛到路由器上,提供站点间的容量。

贯穿每个站点的保障

IP Maestro 提供对整个部署的统一视图,让运营商能在众多站点和 N+1 设计中守住推理的服务水平。

开放硬件,更低成本

neocloud 守得住的成本基础

neocloud 靠价格和扩展速度竞争,因此网络不能成为一种专有税。开放网络让运营商掌控硬件、软件和交付周期,同时仍由一家厂商负责软件与支持。

多厂商供应链

Switches from Edgecore、UfiSpace 等厂商的交换机 运行同一个 OcNOS 镜像,因此运营商在硬件或交付周期上从不被单一厂商绑定。

更低的硬件成本

运行在开放商用芯片交换机上的 OcNOS 承载 AI fabric,成本 降低 40% 到 60% ,在相当的端口速率和 radix 下低于专有平台。

由一家厂商负责修复

硬件与软件按各自独立的周期更新,但 一份支持合同 覆盖整个系统,因此由一个团队负责修复。

经生产环境验证

这张开放网络已经在大规模运行

neocloud fabric 不是实验室里的演练。它运行的是与全球运营商承载生产流量相同的 OcNOS,跑在相同的开放硬件上。

600+
家运营商网络在服务提供商、数据中心和互联网交换中心运行 OcNOS。
60+
个国家中,OcNOS 如今承载着实时生产流量。
40+
个以上经过验证的开放硬件平台从同一个镜像运行 OcNOS。
常见问题

neocloud 网络问答

什么是 neocloud?
neocloud 是一种以 AI 为先的云服务商,围绕用于训练与推理的高密度 GPU 算力构建,而非传统超大规模云的通用服务。neocloud 靠加速器的原始性能、扩展速度和成本竞争,因此承载 GPU 流量的网络是其经济性的核心,而非事后考虑。
neocloud 用 InfiniBand 还是以太网?
两者都有部署,而随着 800G 的到来,行业正走向以太网。基于 RoCEv2 的以太网在开放的商用芯片上承载 GPU 集合通信流量,因此 neocloud 无需单一厂商技术栈即可获得无损 AI fabric。OcNOS 在经过验证的开放硬件上运行完整的 RoCEv2 工具集,包括 priority flow control、ECN 和自适应负载均衡。
neocloud 该为训练与推理建一张网络还是两张?
训练与推理是相反的工作负载:训练集中且吃带宽,推理分散、突发且对时延敏感。建两张独立网络会让资本与运营成本翻倍。把两者放在一张 OcNOS fabric、一个控制平面上运行,能让 neocloud 用同一套基础设施承载训练和每一个推理工作负载,运营利润率正是在这里得到改善。
neocloud 何时仍然需要两张独立的网络?
有些运营商会刻意分离训练与推理,而且理由充分:租户之间的严格隔离、不同团队各自的运维域、明确的性能边界,或已经承载训练的现有 InfiniBand 孤岛。OcNOS 两种方式都能运行。关键在于,分离应当是有意为之的设计选择,而不是架构强加给你的成本。当同一个团队能够在一个控制平面上运行这两种工作负载时,按角色规划并授权的一张 fabric,才是守住利润率的默认选择。
分布式推理对网络有什么要求?
推理分散在众多区域和边缘站点,能快速伸缩,并要守住严格的时延目标,因此网络需要弹性容量、每一层的冗余,以及站点之间的低时延传输。IP Infusion 覆盖整条路径:数据中心 fabric、站点之间的传输与 IP over DWDM,以及用于保障的 IP Maestro。
开放网络如何降低 neocloud 的成本?
neocloud 从多厂商供应链按各自独立的周期采购交换机和软件,因此在硬件、软件或交付周期上都不被单一厂商绑定。运行在开放商用芯片交换机上的 OcNOS,以低于专有平台的硬件成本承载 AI fabric,而软件与支持仍由一家厂商在一份合同下负责。

用一个控制平面设计你的 neocloud fabric

告诉我们你的 GPU 规模和计划服务的站点,IP Infusion 工程师将帮助你设计一张用于训练与推理的开放 fabric。