Neocloud · AI 训练与推理

面向 neocloud 的网络:用一张 fabric 承载 AI 训练与推理

neocloud 在同一套基础设施上运行训练与推理。IP Infusion 为两者提供开放网络: 运行在经过验证的开放硬件上的 OcNOS,为 GPU 集群提供无损 RoCEv2、在边缘进行分布式推理、在站点之间提供开放传输,全部由一个控制平面交付。借助 OcNOS Systems,一份支持合同即可覆盖硬件、软件与光模块。

1 张 fabric训练与推理
最高 800G以太网 AI fabric
40% 到 60%更低的硬件成本
600+运营商网络
两种工作负载,一门生意

训练与推理把网络拉向相反的方向

每个 neocloud 都要同时服务两者。训练用稳定、同步的流量填满少数几个大型集群。推理则分散在众多站点并会毫无预警地激增。fabric 必须同时兼顾两者,否则那些能带来收入的工作负载就会转向别处。

训练与推理对比,按决定 fabric 的网络指标逐项列出。
网络所面对的 训练AI 工厂 推理实时服务
分布少数几个大型 GPU 集群众多区域和边缘站点
流量大批量、同步的 GPU 到 GPU 集合通信小而对时延敏感的请求
负载特征长时间保持接近满载的 GPU 利用率突发且弹性,数秒内激增
网络必须做到在持续带宽下保持无损低时延,且每一层都冗余
故障容忍度容忍度高,作业可做检查点并恢复低,每个请求都有严格 SLA
决定你利润率的网络抉择

一张 fabric,还是两张?

每个 neocloud 都要回答同一个问题:为承载训练与推理,它要建几张网络?答案决定了整个建设周期的成本基础。

一张训练网络,再加一张用于推理

一张 fabric 用于训练,再另外拼上一张用于推理。两套设计、两套备件、两个运维团队、两套升级周期。在第一个客户到来之前,资本与运营成本就已翻倍,而这一切都要由利润去消化。

资本与运营支出翻倍,利润承压

训练与推理运行在一个控制平面上

两种工作负载都运行在同一张 OcNOS 网络上。 同一 OcNOS 产品家族,一个控制平面。 训练 fabric 与分布式推理站点是同一个平台,按角色进行规格设计与授权,因此运营商可以在自己已有的基础设施上,承接训练以及随之而来的每一个推理工作负载。

一张 fabric,成本随业务扩展
面向 neocloud 的一张 OcNOS fabric:左侧是以最高 800G 运行无损 RoCEv2 的 leaf-spine GPU 训练集群,右侧是分布式推理站点,通过开放的 IP over DWDM 传输相连,全部处于一个 OcNOS 控制平面之下。
一张用于训练与推理的 OcNOS fabric:无损 RoCEv2 的 GPU 训练集群、分布式推理站点,以及它们之间的开放传输,全部在一个控制平面之下。
训练 fabric

面向 GPU 集群的无损以太网 fabric

训练在 GPU 之间搬运大批量、同步的流量,因此 fabric 在负载下必须保持无损。OcNOS 在开放的商用芯片上以最高 800G 运行 RoCEv2 工具集,让 AI 工厂无需单一厂商的技术栈即可获得高基数以太网 fabric。

无损 RoCEv2

优先级流控、ECN 与 DCQCN 让 GPU 集合通信流量避免丢包,并通过自适应负载均衡将其分散到整个 fabric。

在开放芯片上最高 800G

高基数以太网,运行在 经过验证的开放硬件 多家厂商的硬件之上,承载训练 fabric,并留有横向扩展集群的余量。

为 GPU 技术栈就绪

fabric 承载 GPU 集合通信库(NCCL、RCCL、oneCCL) 训练作业在其上运行,因此网络不会成为 AllReduce 的瓶颈。

同一 OcNOS 产品家族,覆盖每一个规模层级
机架
GPU 服务器 + leaf
你扩容的基本单位:置于架顶(ToR)leaf 之后的 GPU 服务器。
Pod
Leaf-spine 模块
无阻塞的 leaf-spine 模块,是 fabric 可复制的构建单元。
集群
最多 4,096 个 GPU
运行在一张无损 RoCEv2 fabric 上的完整训练集群。
多集群
16,384 个 GPU 的设计
多个集群加上分布式推理站点,统一在一个控制平面下。

OcNOS 运行于每一个层级,因此 fabric 随集群一起横向扩展,而不必在每一步重新设计。

分布式推理

推理位于边缘,需要网络跟得上

推理分散在众多区域和边缘站点,能快速伸缩,并要守住严格的时延目标。在这里,neocloud 需要的不只是数据中心 fabric:它需要站点之间的传输,以及贯穿所有站点的保障。IP Infusion 覆盖整条路径。

每个站点的数据中心 fabric

运行在开放交换机上的 EVPN-VXLAN 叶脊 fabric 服务每个推理站点,并具备随需求增减容量的弹性。

站点之间的开放传输

低时延传输将各站点连接起来。 采用相干 ZR 与 ZR+ 的 IP over DWDM 将光层收敛到路由器上,提供站点间的容量。

贯穿每个站点的保障

IP Maestro 提供对整个部署的统一视图,让运营商能在众多站点和 N+1 设计中守住推理的服务水平。

开放硬件,更低成本

neocloud 守得住的成本基础

neocloud 靠价格和扩展速度竞争,因此网络不能成为一种专有税。开放网络让运营商掌控硬件、软件和交付周期,同时仍由一家厂商负责软件与支持。

多厂商供应链

交换机来自 Edgecore、UfiSpace 等厂商的交换机 均运行 OcNOS,因此运营商在硬件或交付周期上从不被单一厂商绑定。

更低的硬件成本

运行在开放商用芯片交换机上的 OcNOS 承载 AI fabric,成本 降低 40% 到 60% ,在相当的端口速率和 radix 下低于专有平台。

由一家厂商负责修复

硬件与软件按各自独立的周期更新。借助 OcNOS Systems,一份支持合同即可覆盖硬件、软件与光模块,因此由一个团队负责修复。

经生产环境验证

这张开放网络已经在大规模运行

neocloud fabric 不是实验室里的演练。它运行的是与全球运营商承载生产流量相同的 OcNOS,跑在相同的开放硬件上。

600+
家运营商网络在服务提供商、数据中心和互联网交换中心运行 OcNOS。
60+
个国家中,OcNOS 如今承载着实时生产流量。
40+
个以上经过验证的开放硬件平台运行 OcNOS。

neocloud 网络问答

什么是 neocloud?
neocloud 是一种以 AI 为先的云服务商,围绕用于训练与推理的高密度 GPU 算力构建,而非传统超大规模云的通用服务。neocloud 靠加速器的原始性能、扩展速度和成本竞争,因此承载 GPU 流量的网络是其经济性的核心,而非事后考虑。
neocloud 在训练和推理中运行哪种 fabric?
OcNOS 在最高 800G 的经过验证的开放通用芯片硬件上,以基于 RoCEv2 的以太网运行 neocloud fabric。优先级流控、ECN 与自适应负载均衡使 GPU 集合通信流量保持无损,因此 neocloud 无需单一厂商的技术栈,即可获得一张同时服务训练与推理的以太网 AI fabric。
neocloud 该为训练与推理建一张网络还是两张?
训练与推理是相反的工作负载:训练集中且吃带宽,推理分散、突发且对时延敏感。建两张独立网络会让资本与运营成本翻倍。把两者放在一张 OcNOS fabric、一个控制平面上运行,能让 neocloud 用同一套基础设施承载训练和每一个推理工作负载,运营利润率正是在这里得到改善。
neocloud 何时仍然需要两张独立的网络?
有些运营商会刻意分离训练与推理,而且理由充分:租户之间的严格隔离、不同团队各自的运维域、明确的性能边界,或运营商保留的现有训练 fabric。OcNOS 两种方式都能运行。关键在于,分离应当是有意为之的设计选择,而不是架构强加给您的成本。当同一个团队能够在一个控制平面上运行这两种工作负载时,按角色规划并授权的一张 fabric,才是守住利润率的默认选择。
分布式推理对网络有什么要求?
推理分散在众多区域和边缘站点,能快速伸缩,并要守住严格的时延目标,因此网络需要弹性容量、每一层的冗余,以及站点之间的低时延传输。IP Infusion 覆盖整条路径:数据中心 fabric、站点之间的传输与 IP over DWDM,以及用于保障的 IP Maestro。
开放网络如何降低 neocloud 的成本?
neocloud 从多厂商供应链按各自独立的周期采购交换机和软件,因此在硬件、软件或交付周期上都不被单一厂商绑定。运行在开放通用芯片交换机上的 OcNOS,以低于专有平台的硬件成本承载 AI fabric,并由 IP Infusion 为 OcNOS 软件提供支持。借助 OcNOS Systems,一份支持合同即可覆盖硬件、软件与光模块。

用一个控制平面设计你的 neocloud fabric

告诉我们你的 GPU 规模和计划服务的站点,IP Infusion 工程师将帮助你设计一张用于训练与推理的开放 fabric。