RoCEv2 · DCQCN · DLB · 800G

OcNOS AI Fabric:用于 GPU 集群的开放 800G 无损以太网

OcNOS AI Fabric 将运营商级网络能力带入 GPU 集群:一套完整的无损以太网系统。IP Infusion 以 OcNOS Systems 的形式整体交付:来自 Edgecore 或 UfiSpace、运行 OcNOS-DC 的已验证 800G 开放交换机,由一份支持合同覆盖,同时保持您在 NIC、GPU 和交换机上的选择开放。它已在生产环境中承载基于 PFC、基于 ECN 的拥塞控制(DCQCN)和亚毫秒级 DLB 的无损 RoCEv2 RDMA。IP Infusion 是 Ultra Ethernet Consortium 的成员。

600+生产环境中的 OcNOS 网络
60+已服务的国家
始于 1999 年生产环境中的路由协议栈
数千规模GPU 参考设计

哪些因素决定任务完成时间

在大规模场景下,真正重要的是任务完成的速度和 GPU 的利用率,而不是交换机吞吐量。每当集群暂停以进行同步时,空闲的 GPU 就会浪费算力,因此架构必须做到零丢包,并在拥塞刚出现的瞬间就作出响应。

OcNOS-DC 开放所有设置,您的团队可以根据真实的 GPU 集合通信流量(xCCL:NCCL、RCCL、oneCCL)调优 fabric,而不必接受厂商的固定配置。下面每种模式都是集群停滞的一种原因,以及 OcNOS-DC 如何保持其持续运行。

每个 GPU 同时与其他所有 GPU 通信
标准负载均衡会将这些大流量固定到单条上行链路上,导致部分链路拥塞、其他链路空闲,而同步过程只能等待最慢的那条链路。
→ DLB 在一毫秒内将流量切换至更空闲的路径。
→ GLB 在 OcNOS 7.1 中可在整个 fabric 范围内实现均衡,而不仅限于本地一跳。
结果: 不再出现流量热点,同步环节以接近满速运行。
训练同步(AllReduce)
众多发送端在微秒级内涌向同一端口
一个丢包会导致整个集合通信重启,而过度暂停又会冻结链路,因此 fabric 必须尽早化解拥塞。
→ DCQCN 在任何缓冲区溢出之前,就提前减缓发送端速率。
→ PFC watchdog 可自动清除卡滞的端口。
结果: 任务可平稳度过流量突发,卡滞的端口无需人工重置即可自行恢复。
流量突发(incast)
单条流需要同时使用每条并行路径
目前一条流只走哈希选定的单条路径,其余轨道 均处于闲置状态。
→ DLB 在您当前运行的 RoCEv2 fabric 上,将 flowlet 从繁忙路径上移开。
→ Ultra Ethernet(UEC) 是一种多路径传输,从支持 UEC 的 NIC 将一条流分散到多条路径上。
结果: 当前即可更充分地利用每条轨道,随着 UEC NIC 逐步部署,还可获得标准的多路径传输。
横向扩展(multi-rail)
目标 90%+

容量的去向。 静态 ECMP 将每条大流固定在一条路径上,导致大象流在少数上行链路上冲突,而其他链路闲置。动态负载均衡根据实时拥塞重新绑定流量,使每条上行链路保持繁忙,因此运行良好的 AI fabric 可在相同交换机上将利用率目标设在 90% 区间,无需额外上行链路。OcNOS-DC 在 Tomahawk 4 与 5 上提供 DLB。

DLB 深度解析 →

800G 脊叶架构, 端到端无损

这正是您团队已经熟悉的叶脊(Clos)设计,专为无损运行 GPU 流量而构建:路由式 eBGP 底层将流量均匀分散到每一条路径上,无损优先级队列保护 RoCEv2 流,独立的管理网络则自行启用交换机并流式传输遥测数据。用于检查点与数据集、挂接于叶节点的 NVMe-oF 与 NFS 存储紧邻 GPU 机架;请参见 DC 网络 了解存储 fabric 详情。将鼠标悬停在任一节点上可查看平台、端口数量与芯片。

AI 网络拓扑:800G spine-leaf 架构,包含并行 leaf、全互联 eBGP、独立的管理总线以及 leaf 侧挂接的存储
AI Fabric:800G spine-leaf 架构,全互联 eBGP、独立的管理总线以及 leaf 侧挂接的存储。

每块 GPU NIC 独占一条 rail,可跨 pod 扩展

在 rail 优化 fabric 中,每台 GPU 服务器分别将一块 NIC 连接到八台专用 rail leaf 中的每一台,因此占主导的同 rail AllReduce 流量停留在一台 leaf 上,只有跨 rail 流量才会到达 spine。它可在相同的 800G Tomahawk 5 交换机上逐个 pod 扩展。请参阅 rail 优化深入解析 以及完整的 参考拓扑.

rail 优化 AI fabric 拓扑:四台 800G Tomahawk 5 spine 位于八台 rail leaf 之上,四台 GPU 服务器各自将其八块 NIC 中的一块映射到不同的 rail leaf,因此 rail 内 AllReduce 停留在一台 leaf 上。
rail 优化单 pod:每台 GPU 服务器的 8 块 NIC 按每条 rail 一块映射到 8 台专用 leaf,因此同 rail AllReduce 停留在 leaf 上,只有跨 rail 流量才会到达 spine。

经验证的开放交换机

OcNOS-DC 运行于来自 Edgecore 与 UfiSpace 的 Broadcom Tomahawk 和 Trident 交换机之上,因此每个平台都经过验证、可下单采购并具备第二货源。

Edgecore AIS800-64D 800G spine 交换机

Edgecore AIS800-64D

64 x 800G · 51.2 Tbps

QSFP-DD800 · 拆分为 2x400G / 4x200G / 8x100G

Spine · Tomahawk 5
数据手册 →
UfiSpace S9321-64E 800G spine 交换机

UfiSpace S9321-64E

64 x 800G · 51.2 Tbps

QSFP-DD800 · 拆分为 2x400G / 4x200G / 8x100G

Spine · Tomahawk 5
数据手册 →
Edgecore AS9736-64D 400G leaf 交换机

Edgecore AS9736-64D

64 x 400G · 25.6 Tbps

QSFP56-DD 400G · 拆分为 4x100G / 4x25G · DAC / AOC

Leaf · Tomahawk 4
数据手册 →

在 HCL 中查看全部 40+ 经验证平台 →

Broadcom Tomahawk 与 Trident 系列有何不同,以及 OcNOS 运行的所有开放交换机 →

OcNOS Systems:软件、硬件与支持均由同一家厂商负责

一份合同,一个团队响应

以 OcNOS Systems 形式采购时,fabric 只需一份 IP Infusion 合同即可同时涵盖 OcNOS-DC 软件与经过验证的交换机硬件,因此只需对接一个 TAC 和一份 SLA,无需分别面对 NOS 与硬件供应商。Premium 与 Enterprise 等级提供 24/7 支持门户。

查看支持详情

统一管理 fabric 的单一控制台

IP Maestro 是面向 OcNOS 的网元管理系统:通过 NETCONF 管理每台交换机的拓扑、故障、配置和软件镜像,位于您现有 OSS 之下。从一个控制台管理大型多站点设备群。

了解 IP Maestro

流式遥测与零接触部署

gNMI 流式遥测将数据送入 Prometheus 与 Grafana,DCBX 自动向每台服务器下发正确的无损配置,零接触部署则让交换机在启动时即完成配置并上线。

探索自动化

面向 NVIDIA Spectrum-X 的开放、多厂商替代方案

OcNOS-DC 在来自多家开放硬件厂商的标准以太网交换机上运行无损 RoCEv2 AI fabric,以 OcNOS Systems 形式采购时由一份支持合同覆盖。它匹配 AI 训练作业所依赖的 fabric 机制,同时使 NIC、GPU 和硬件的选择保持开放,而非锁定于单一厂商。

基于 OcNOS-DC 的开放式 AI Fabric 与封闭的单一厂商 AI 技术栈对比。最近核实:2026 年 7 月。
决定成交的因素 开放式 AI Fabric(运行于 Edgecore / UfiSpace 上的 OcNOS-DC) 封闭的 NIC 加交换机堆栈
硬件采购 来自多家厂商的开放通用芯片(Edgecore、UfiSpace) 单一厂商交换机、NIC 与 GPU
NIC 和 GPU 选择 开放:可独立更换 NIC 与 GPU NIC 与 GPU 路线图受制于一家厂商
无损 RoCEv2(PFC、ECN、DCQCN) ✓ 详情 → ✓
自适应负载均衡 ✓ 亚毫秒级 DLB flowlet 重绑定 详情 → ✓ (专有)
PFC 死锁保护 ✓ 带自动排空的死锁 watchdog 详情 → ✓
流式遥测与自动化 ✓ gNMI, OpenConfig, ZTP, DCBX, Ansible ✓ (厂商流水线)
单一支持合同(交换机与软件) ✓ OcNOS Systems:一个 TAC,一个 SLA ✓ (单一厂商)
GPU 芯片后端集成 标准以太网;无 GPU 芯片协同设计 NIC、交换机与 GPU 由同一家厂商协同设计
Fabric 控制器层 通过 gNMI 遥测以及您的 OSS 或 IP Maestro 进行管理 厂商集成的 fabric 控制器层

NVIDIA 和 Spectrum-X 是 NVIDIA Corporation 的商标。IP Infusion 与 NVIDIA 无关联,也不为 NVIDIA 背书;本比较反映的 OcNOS-DC 能力可在以下资料中核实: 功能矩阵.

OcNOS-DC 的定位

OcNOS-DC 达到了 2026 年大多数 AI fabric 方案共有的技术标准:无损 RoCEv2、拥塞控制与自适应路由。因此决策最终归结为 合作条款的形态:开放的操作系统还是封闭的技术栈,开放的硬件还是封闭的硬件,标准 Ethernet 还是封闭的 InfiniBand。 Here is where each one leaves you.

解决方案形态 定义 权衡
开放 NOS,为 AI 强化 OcNOS-DC 运行于 Edgecore / UfiSpace 相同的 Broadcom 芯片,相同的技术底座。为 RDMA 集合通信流量调优的 DCQCN、亚毫秒级 DLB、OcNOS 7.1 中提供的 GLB、PFC 死锁看门狗。OcNOS Systems 只需一份支持合同。不存在 NIC、GPU 或硬件锁定。
封闭式垂直 AI 栈 NIC、交换机与 fabric 软件来自同一家厂商 NIC、交换机与 fabric 软件一体集成,绑定单一厂商及单一 GPU 路线图。
专有硬件 NOS 仅随该厂商交换机销售的厂商 NOS 底层往往是相同的通用芯片。按端口授权带来溢价。遥测与调优受限于厂商自有的管线。
基于信元的专有机箱式 fabric 基于专有机箱软件的调度式信元 fabric 不同的架构:调度式信元 fabric,而非 以太网 NOS。无法移植到标准交换机上。
闭环 InfiniBand 独立于以太网的 InfiniBand NIC 与交换机 在紧耦合集合通信场景中延迟较低,但需要独立布线、独立运维,且生态由单一厂商主导。
开放 NOS,未做 AI 强化 社区开源 NOS 发行版 开放硬件、免费软件、无 SLA。针对 RDMA 优化的 DCQCN 默认值、死锁看门狗以及调优成熟度完全由运营商自行负责。

每种方案的侧重点各不相同。OcNOS-DC 的优势在于开放硬件、完整方案以及无锁定。

AI Fabric 规模规划指南

数分钟内完成 GPU fabric 规模规划

输入 GPU 数量与 NIC 速率。AI Fabric Design Suite 会据此生成 leaf-spine 拓扑、交换机与端口数量,以及可直接用于询价的物料清单。无需电子表格。

常见问题

OcNOS-DC 是否真正 "AI-native"、还是仅在 RoCEv2 基础上加了些扩展?
没有哪个基于通用芯片的以太网 NOS 是真正意义上的 AI 原生:没有一个会在交换机上感知 xCCL(NCCL / RCCL / oneCCL)集合通信或调度作业;那属于 NIC 和调度器。OcNOS-DC 实现了 2026 年 AI 工作负载所需的每一项 fabric 机制:无损 RoCEv2、针对 RDMA 集合通信流量模式调优的 DCQCN 缓冲区配置、亚毫秒级 DLB flowlet 重绑定,以及 PFC 死锁看门狗,同时不涉足上层。所谓“AI 感知 fabric”通常只是指某家厂商将 NIC + 交换机 + 调度器作为一个锁定的 SKU 出售。
OcNOS-DC 的边界在哪里,NIC 与集群调度器又从何处接管?
OcNOS-DC 负责 layer 1:lossless RDMA 传输、拥塞控制、自适应路由、死锁恢复、遥测。NIC 负责 layer 2(xCCL、RDMA verbs、packet spray、GPU-Direct 内存);调度器负责 layer 3(作业放置、梯度同步窗口、租户隔离)。OcNOS-DC 将 gNMI 遥测数据流式上送至 layer 3,但绝不试图扮演调度器:这种分层使 NIC、GPU 与编排系统始终保持可替换。
OcNOS AI Fabric 与 NVIDIA Spectrum-X、SONiC、Arista、Cisco 或 DriveNets 相比如何?
OcNOS-DC 提供完整的 AI fabric:经过验证的开放交换机与 OcNOS-DC,以 OcNOS Systems 形式在一份支持合同下交付,来自运行服务提供商网络的同一 OcNOS 产品家族。它运行在 Broadcom 芯片上,提供无损 RoCEv2(PFC、ECN、具备 Reactive Path Rebalance 的亚毫秒级 DLB)、PFC 死锁恢复,以及 Premium 和 Enterprise 等级的 24/7 支持,不存在 NIC、GPU 或硬件锁定。其他方案的差异在于交易形态。封闭的 NIC 加交换机堆栈会在 NIC、交换机和 GPU 路线图上把 fabric 绑定到一家厂商。专有硬件 NOS 方案在锁定的硬件上以按端口授权方式运行类似的 RoCEv2 功能。社区开源 NOS 发行版把 AI 调优的默认配置、死锁看门狗和 SLA 都留给运营方自行解决。基于信元的机箱式 fabric 采用调度信元架构,而不是标准以太网 NOS。
Ultra Ethernet (UEC) 1.0 对 OcNOS AI Fabric 意味着什么?
OcNOS-DC 如今已在生产环境中运行基于 DCQCN 和亚毫秒级 DLB 的无损 RoCEv2,IP Infusion 是 Ultra Ethernet Consortium(UEC)的成员。UEC 1.0 定义了一种多路径以太网传输,将一条流分散到多条路径上,而不是固定在单个 ECMP 哈希上,这一端点行为运行在支持 UEC 的 NIC 上。如需规划 UEC 在具体部署中的定位,请咨询 IP Infusion 工程师,并参阅 Ultra Ethernet 深度解析。
RoCEv2 是什么,为什么需要无损以太网架构?
您的训练集合通信 AllReduce 和 AllGather 通过 RoCEv2 在 GPU 之间直接搬运数据,路径中不经过 CPU,而 RDMA 从不重传,因此单个丢失的报文就会让该操作在任务的每一块 GPU 上重新开始。这正是生产级 RoCEv2 需要真正无损架构(PFC 加 ECN)的原因,OcNOS-DC 随附针对 RDMA 集合通信流量调优的 RoCEv2 缓冲配置和 DCQCN 默认值,让您的团队无需从零构建这种无损行为。
OcNOS-DC 如何保持 fabric 无损,又如何防范 PFC 死锁?
三种机制:PFC 在缓冲区溢出前按优先级暂停流量;ECN 提前标记报文以让发送端减速;ETS 让 RDMA 流量优先于较低优先级流量。在此之上,按端口、按优先级的 deadlock watchdog 会检测暂停队列的循环,并在作业挂起前自动清空队列:过去这种故障模式曾迫使在作业中途对交换机进行电源重启。PFC over L3 在路由边界之间同样受支持。
什么是 DLB?OcNOS 7.1 中的 GLB 又带来了哪些变化?
在 AllReduce 过程中,当标准 ECMP 在整个生命周期内将每条流固定绑定到单条上行链路时,最大的几条流会相互碰撞,同步则被卡在拥塞链路上等待。DLB 读取 ASIC 队列深度的实时遥测数据,在不到一毫秒内将 flowlet 重新绑定到负载更轻的路径,因此如今就能在本地跳恢复被浪费的吞吐量。将在 OcNOS 7.1 中推出的 GLB 会把同样的理念扩展到整个 fabric:spine 将路径质量遥测数据回传给入口 leaf,使路由能够在数千 GPU 的大型集群中对完整的多跳路径进行评分。
OcNOS AI Fabric 支持何种规模、以及哪些参考设计已通过验证?
OcNOS-DC 支持 400G 与 800G 的 leaf-spine fabric。 Tomahawk 5 spine 交换机(Edgecore AIS800-64D、UfiSpace S9321-64E)提供 51.2 Tbps / 64 × 800G; Tomahawk 4 leaf 运行 400G / 25.6 Tbps,采用片上缓存; Trident 4 适用于较小规模的 100G/400G fabric。参考设计涵盖 rail-only、rail 优化双层以及 rail 优化三层拓扑,适用于数千 GPU 规模的大型集群:请参阅 AI fabric 拓扑深度解析.
OcNOS-DC 是否支持面向 AI 架构运维的自动化与遥测?
是的。DCBX 自动完成服务器到交换机的 RoCEv2 配置,ZTP(IPv4/IPv6)处理零接触上线,gNMI 通过 OpenConfig YANG 流式推送变更触发的遥测数据。PFC 暂停、ECN 标记、DCQCN 阈值和缓冲深度均为 gNMI 传感路径,可由 Prometheus、InfluxDB、Telegraf、Grafana 或任何 OpenTelemetry 管线消费。Ansible playbook 覆盖 Day-0 至 Day-2,Terraform provider 已列入路线图。IP Maestro 作为 OcNOS 的网元管理系统,通过 NETCONF 管理拓扑、故障、配置和软件镜像,并可从一个控制台管理大规模多站点设备群。
OcNOS AI fabric 支持哪些交换机硬件与 800G 光模块?
fabric 运行于 Edgecore 与 UfiSpace 经过验证的 Broadcom Tomahawk 4 与 5 交换机。800G spine(Edgecore AIS800-64D 与 UfiSpace S9321-64E,Tomahawk 5,64 x 800G QSFP-DD800,51.2 Tbps)可拆分为 400G、200G 与 100G;400G leaf(Edgecore AS9736-64D,Tomahawk 4,64 x 400G QSFP56-DD,25.6 Tbps,采用片上缓存)可拆分为 100G 与 25G。光模块已与多家厂商证实互通,请联系我们获取适用于您构建方案的光模块清单。交换平台均列于 HCL 中。
AI fabric 由谁提供支持,硬件是否也在覆盖范围内?
以 OcNOS Systems 形式采购 fabric 时,一份 IP Infusion 合同即可同时涵盖 OcNOS-DC 软件与经过验证的交换机硬件,因此只需对接一个 TAC 和一份 SLA。支持服务分为多个等级:Standard 包含邮件 TAC、工作时间电话支持与硬件 RMA 协调,P1 响应时间为 8 小时;Premium 增加 24/7 客户支持门户,P1 响应时间为 2 小时;Enterprise 进一步提供 30 分钟 P1 响应,并配备客户成功经理。24/7 门户面向 Premium 与 Enterprise 等级提供。