面向 neocloud 的网络:用一张 fabric 承载 AI 训练与推理
neocloud 在同一套基础设施上运行训练与推理。IP Infusion 为两者提供开放网络: 运行在经过验证的开放硬件上的 OcNOS,为 GPU 集群提供无损 RoCEv2、在边缘进行分布式推理、在站点之间提供开放传输,全部由一个控制平面和一份支持合同交付。
训练与推理把网络拉向相反的方向
每个 neocloud 都要同时服务两者。训练用稳定、同步的流量填满少数几个大型集群。推理则分散在众多站点并会毫无预警地激增。fabric 必须同时兼顾两者,否则那些能带来收入的工作负载就会转向别处。
| 网络所面对的 | 训练AI 工厂 | 推理实时服务 |
|---|---|---|
| 分布 | 少数几个大型 GPU 集群 | 众多区域和边缘站点 |
| 流量 | 大批量、同步的 GPU 到 GPU 集合通信 | 小而对时延敏感的请求 |
| 负载特征 | 长时间保持接近满载的 GPU 利用率 | 突发且弹性,数秒内激增 |
| 网络必须做到 | 在持续带宽下保持无损 | 低时延,且每一层都冗余 |
| 故障容忍度 | 容忍度高,作业可做检查点并恢复 | 低,每个请求都有严格 SLA |
一张 fabric,还是两张?
每个 neocloud 都要回答同一个问题:为承载训练与推理,它要建几张网络?答案决定了整个建设周期的成本基础。
一张训练网络,再加一张用于推理
一张 fabric 用于训练,再另外拼上一张用于推理。两套设计、两套备件、两个运维团队、两套升级周期。在第一个客户到来之前,资本与运营成本就已翻倍,而这一切都要由利润去消化。
训练与推理运行在一个控制平面上
两种工作负载都运行在同一张 OcNOS 网络上。 一个镜像、一个控制平面、一份支持合同。 训练 fabric 与分布式推理站点是同一个平台,按角色进行规格设计与授权,因此运营商可以在自己已有的基础设施上,承接训练以及随之而来的每一个推理工作负载。

面向 GPU 集群的无损以太网 fabric
训练在 GPU 之间搬运大批量、同步的流量,因此 fabric 在负载下必须保持无损。OcNOS 在开放的商用芯片上以最高 800G 运行 RoCEv2 工具集,让 AI 工厂无需单一厂商的技术栈即可获得高基数以太网 fabric。
无损 RoCEv2
Priority flow control, ECN, and DCQCN 让 GPU 集合通信流量避免丢包,并通过自适应负载均衡将其分散到整个 fabric。
为 GPU 技术栈就绪
fabric 承载 GPU collective libraries (NCCL, RCCL, oneCCL) 训练作业在其上运行,因此网络不会成为 AllReduce 的瓶颈。
同一套 OcNOS 镜像运行于每一个层级,因此 fabric 随集群一起横向扩展,而不必在每一步重新设计。
推理位于边缘,需要网络跟得上
推理分散在众多区域和边缘站点,能快速伸缩,并要守住严格的时延目标。在这里,neocloud 需要的不只是数据中心 fabric:它需要站点之间的传输,以及贯穿所有站点的保障。IP Infusion 覆盖整条路径。
neocloud 守得住的成本基础
neocloud 靠价格和扩展速度竞争,因此网络不能成为一种专有税。开放网络让运营商掌控硬件、软件和交付周期,同时仍由一家厂商负责软件与支持。
这张开放网络已经在大规模运行
neocloud fabric 不是实验室里的演练。它运行的是与全球运营商承载生产流量相同的 OcNOS,跑在相同的开放硬件上。
neocloud 网络问答
什么是 neocloud?
neocloud 用 InfiniBand 还是以太网?
neocloud 该为训练与推理建一张网络还是两张?
neocloud 何时仍然需要两张独立的网络?
分布式推理对网络有什么要求?
开放网络如何降低 neocloud 的成本?
带走 OcNOS-DC 数据手册
一份比本页更深入的简短技术下载:完整的 OcNOS-DC 数据手册。
OcNOS-DC 数据手册
表单简短。提交后您的 PDF 将立即在新标签页中打开。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
用一个控制平面设计你的 neocloud fabric
告诉我们你的 GPU 规模和计划服务的站点,IP Infusion 工程师将帮助你设计一张用于训练与推理的开放 fabric。
需要我们联系您吗?
留下您的信息,IP Infusion 工程师将帮助您设计一张用于 AI 训练与推理的开放 fabric。仅在您希望时我们才会与您联系。