RoCEv2 · DCQCN · DLB · UEC 1.0 ready

基于标准 Ethernet 的开放 800G AI fabric

You can build a production GPU-cluster fabric on standard Ethernet and keep your NIC, GPU, and switch choices open. IP Infusion delivers that fabric complete: validated 800G open switches from Edgecore or UfiSpace running OcNOS-DC, supported under one contract. It carries lossless RoCEv2 RDMA with PFC, ECN-based congestion control (DCQCN), and sub-millisecond DLB in production today. IP Infusion 是 Ultra Ethernet 联盟的贡献成员,OcNOS-DC 与 Ultra Ethernet 1.0 fabric profile.

600+生产环境中的 OcNOS 网络
60+已服务的国家
26 年生产环境中的路由协议栈
Multi-
thousand
GPU 参考设计
The stakes

哪些因素决定任务完成时间

在大规模场景下,真正重要的是任务完成的速度和 GPU 的利用率,而不是交换机吞吐量。每当集群暂停以进行同步时,空闲的 GPU 就会浪费算力,因此架构必须做到零丢包,并在拥塞刚出现的瞬间就作出响应。

OcNOS-DC exposes every setting, so your team tunes the fabric against your real GPU collective traffic (xCCL: NCCL, RCCL, oneCCL) instead of accepting a vendor's fixed profile. Each pattern below is one way a cluster stalls, and how OcNOS-DC keeps it moving.

训练同步(AllReduce)
每个 GPU 同时与其他所有 GPU 通信
标准负载均衡会将这些大流量固定到单条上行链路上,导致部分链路拥塞、其他链路空闲,而同步过程只能等待最慢的那条链路。
DLB 在一毫秒内将流量切换至更空闲的路径。
GLB is on the OcNOS roadmap to balance across the whole fabric, not just the local hop.
结果: 不再出现流量热点,同步环节以接近满速运行。
流量突发(incast)
众多发送端在微秒级内涌向同一端口
一个丢包会导致整个集合通信重启,而过度暂停又会冻结链路,因此 fabric 必须尽早化解拥塞。
DCQCN 在任何缓冲区溢出之前,就提前减缓发送端速率。
PFC watchdog 可自动清除卡滞的端口。
结果: 任务可平稳度过流量突发,卡滞的端口无需人工重置即可自行恢复。
横向扩展(multi-rail)
单条流需要同时使用每条并行路径
目前一条流只走单条路径,其余 rail 均处于闲置状态。
Ultra Ethernet(UEC 1.0) 将单条流同时分散到每条路径上。
→ 今天采购的交换机在 UEC NIC 到来时可继续沿用,无需更换。
结果: 随着 UEC NIC 逐步部署,最慢的传输也会随之加速。
90%+ target

Where the capacity goes. Static ECMP pins each large flow to one path, so elephant flows collide on a few uplinks while others sit idle. Dynamic load balancing rebinds flows on real-time congestion to keep every uplink busy, so a well-run AI fabric targets utilization in the 90% range on the same switches, with no extra uplinks. OcNOS-DC ships DLB on Tomahawk 4 and 5.

DLB 深度解析 →
Reference topology

800G spine-leaf, 端到端无损

这正是您团队已经熟悉的叶脊(Clos)设计,专为无损运行 GPU 流量而构建:路由式 eBGP 底层将流量均匀分散到每一条路径上,无损优先级队列保护 RoCEv2 流,独立的管理网络则自行启用交换机并流式传输遥测数据。用于检查点与数据集、挂接于叶节点的 NVMe-oF 与 NFS 存储紧邻 GPU 机架;请参见 DC 网络 for storage-fabric detail. Hover any node for platform, port count, and chip.

AI 网络拓扑:800G spine-leaf 架构,包含并行 leaf、全互联 eBGP、独立的管理总线以及 leaf 侧挂接的存储
AI Fabric:800G spine-leaf 架构,全互联 eBGP、独立的管理总线以及 leaf 侧挂接的存储。
Rail-optimized reference design

Every GPU NIC on its own rail, scaling across pods

In a rail-optimized fabric each GPU server homes one NIC to each of eight dedicated rail leaves, so the dominant same-rail AllReduce stays on one leaf and only cross-rail traffic reaches the spine. It scales pod by pod on the same 800G Tomahawk 5 switches. See the rail-optimized deep-dive and the full reference topologies.

Rail-optimized AI fabric topology: four 800G Tomahawk 5 spines above eight rail leaves, with four GPU servers each mapping one of its eight NICs to a different rail leaf, so intra-rail AllReduce stays on one leaf.
Rail-optimized single pod: each GPU server's 8 NICs map one per rail to 8 dedicated leaves, so same-rail AllReduce stays on the leaf and only cross-rail traffic reaches the spine.
硬件

经验证的开放交换机

OcNOS-DC 运行于来自 Edgecore 与 UfiSpace 的 Broadcom Tomahawk 和 Trident 交换机之上,因此每个平台都经过验证、可下单采购并具备第二货源。

Edgecore AIS800-64D 800G spine switch
Spine · Tomahawk 5

Edgecore AIS800-64D

64 x 800G · 51.2 Tbps

QSFP-DD800 · 拆分为 2x400G / 4x200G / 8x100G

Datasheet →
UfiSpace S9321-64E 800G spine switch
Spine · Tomahawk 5

UfiSpace S9321-64E

64 x 800G · 51.2 Tbps

QSFP-DD800 · 拆分为 2x400G / 4x200G / 8x100G

Datasheet →
Edgecore AS9736-64D 400G leaf switch
Leaf · Tomahawk 4

Edgecore AS9736-64D

64 x 400G · 25.6 Tbps

QSFP56-DD 400G · 拆分为 4x100G / 4x25G · DAC / AOC

Datasheet →

在 HCL 中查看全部 40+ 经验证平台 →

Broadcom Tomahawk 与 Trident 系列有何不同,以及 OcNOS 运行的所有开放交换机 →

软件、硬件与支持均由同一家厂商负责

单一厂商支持

一份合同,一个团队响应

一份 IP Infusion 合同即可同时涵盖 OcNOS-DC 软件与经过验证的交换机硬件,因此只需对接一个 TAC 和一份 SLA,无需分别面对 NOS 与硬件供应商。Premium 与 Enterprise 等级提供 24/7 支持门户。

查看支持详情
IP MAESTRO MANAGEMENT

统一管理 fabric 的单一控制台

IP Maestro 是面向 OcNOS 的网元管理系统:通过 NETCONF 管理每台交换机的拓扑、故障、配置和软件镜像,位于您现有 OSS 之下。从一个控制台管理大型多站点设备群。

了解 IP Maestro
AUTOMATED DAY 2

流式遥测与零接触部署

gNMI 流式遥测将数据送入 Prometheus 与 Grafana,DCBX 自动向每台服务器下发正确的无损配置,零接触部署则让交换机在启动时即完成配置并上线。

探索自动化
Spectrum-X 的开放式替代方案

面向 NVIDIA Spectrum-X 的开放、多厂商替代方案

OcNOS-DC 在来自多家开放硬件厂商的标准以太网交换机上运行无损 RoCEv2 AI fabric,置于同一份支持合同之下。它匹配 AI 训练作业所依赖的 fabric 机制,同时使 NIC、GPU 和硬件的选择保持开放,而非锁定于单一厂商。

基于 OcNOS-DC 的开放式 AI Fabric 与封闭的单一厂商 AI 技术栈对比。最近核实:2026 年 7 月。
决定成交的因素 开放式 AI Fabric(运行于 Edgecore / UfiSpace 上的 OcNOS-DC) 封闭的单一厂商堆栈(NVIDIA Spectrum-X)
硬件采购 来自多家厂商的开放通用芯片(Edgecore、UfiSpace) 单一厂商交换机、NIC 与 GPU
NIC 和 GPU 选择 开放:可独立更换 NIC 与 GPU 受制于 NVIDIA NIC 与 GPU 路线图
无损 RoCEv2(PFC、ECN、DCQCN) details →
自适应负载均衡 sub-millisecond DLB flowlet rebinding details → (proprietary)
PFC 死锁保护 deadlock watchdog with auto-drain details →
Ultra Ethernet(UEC 1.0) tracks the UEC 1.0 fabric profile details → Aligned; also a UEC contributing member
流式遥测与自动化 gNMI, OpenConfig, ZTP, DCBX, Ansible (vendor pipeline)
单一支持合同(交换机与软件) 一个 TAC,一个 SLA (single vendor)
GPU 芯片后端集成 标准以太网;无 GPU 芯片协同设计 Advantage NVIDIA: NIC, switch, and GPU co-designed
Fabric 控制器层 通过 gNMI 遥测以及您的 OSS 或 IP Maestro 进行管理 Advantage NVIDIA: integrated fabric-controller layer
UEC certification 与 UEC 1.0 fabric 规格保持一致(非认证声明) NVIDIA 是 UEC 指导成员

NVIDIA、Spectrum-X、Quantum 和 ConnectX 是 NVIDIA Corporation 的商标。IP Infusion 与 NVIDIA 无关联,也不为其背书;此对比反映的是可在以下资源中验证的 OcNOS-DC 能力: 功能矩阵.

2026 年 AI fabric 全景

OcNOS-DC 的定位

到 2026 年,几乎每种方案都达到了相同的技术标准:无损 RoCEv2、拥塞控制、自适应路由、Ultra Ethernet 对齐。因此决策最终归结为 合作条款的形态:开放的操作系统还是封闭的技术栈,开放的硬件还是封闭的硬件,标准 Ethernet 还是封闭的 InfiniBand。 Here is where each one leaves you.

解决方案形态 示例 权衡
开放 NOS,面向 AI 强化,符合 UEC OcNOS-DC 运行于 Edgecore / UfiSpace 相同的 Broadcom 芯片,相同的技术底座。为 RDMA 集合通信流量调优的 DCQCN、亚毫秒级 DLB、列入 OcNOS 路线图的 GLB、PFC 死锁看门狗、UEC 1.0 fabric profile。单一厂商支持。不存在 NIC、GPU 或硬件锁定。
封闭式垂直 AI 栈 NVIDIA Spectrum-X + Quantum + ConnectX 集成性能优异。NIC、交换机与 fabric 软件均绑定单一厂商、且绑定单一 GPU 路线图。
封闭式 merchant silicon NOS Arista EOS · Cisco NX-OS · Juniper Junos 底层采用相同的 Broadcom 芯片。按端口收取授权溢价。遥测与调优均受限于该厂商自有的 pipeline。
基于信元的专有机箱式 fabric DriveNets Network Cloud 不同的架构:调度式 cell fabric,而非 Ethernet NOS。在 hyperscale 场景下表现出色;但无法移植到标准交换机上。
闭环 InfiniBand NVIDIA Quantum InfiniBand 目前在紧耦合 collective 场景中延迟最低。但需要独立布线、独立运维,且生态由单一厂商主导。UEC 正在缩小 Ethernet 与其之间的差距。
开放 NOS,未做 AI 强化 社区版 SONiC 开放硬件、免费软件、无 SLA。针对 RDMA 优化的 DCQCN 默认值、死锁看门狗以及调优成熟度完全由运营商自行负责。

每种方案的侧重点各不相同。OcNOS-DC 的优势在于开放硬件、完整方案以及无锁定。

AI Fabric 规模规划指南

数分钟内完成 GPU fabric 规模规划

输入 GPU 数量与 NIC 速率。AI Fabric Design Suite 会据此生成 leaf-spine 拓扑、交换机与端口数量,以及可直接用于询价的物料清单。无需电子表格。

常见问题

常见问题

OcNOS-DC 是否真正 "AI-native"、还是仅在 RoCEv2 基础上加了些扩展?
没有哪个基于通用芯片的以太网 NOS 是真正意义上的 AI 原生:没有一个会在交换机上推理 xCCL(NCCL / RCCL / oneCCL)集合通信或调度作业;那属于 NIC 和调度器。OcNOS-DC 实现了 2026 年 AI 工作负载所需的每一项 fabric 机制:无损 RoCEv2、针对 RDMA 集合通信流量模式调优的 DCQCN 缓存配置、亚毫秒级 DLB flowlet 重绑定、PFC 死锁看门狗、UEC 1.0 对齐,同时不涉足上层。所谓“AI 感知 fabric”通常只是指某家厂商将 NIC + 交换机 + 调度器作为一个锁定的 SKU 出售。
OcNOS-DC 的边界在哪里,NIC 与集群调度器又从何处接管?
OcNOS-DC 负责 layer 1:lossless RDMA 传输、拥塞控制、自适应路由、死锁恢复、遥测。NIC 负责 layer 2(xCCL、RDMA verbs、packet spray、GPU-Direct 内存);调度器负责 layer 3(作业放置、梯度同步窗口、租户隔离)。OcNOS-DC 将 gNMI 遥测数据流式上送至 layer 3,但绝不试图扮演调度器:这种分层使 NIC、GPU 与编排系统始终保持可替换。
OcNOS AI Fabric 与 NVIDIA Spectrum-X、SONiC、Arista、Cisco 或 DriveNets 相比如何?
Spectrum-X is a closed NVIDIA NIC + switch + software stack: excellent performance, single-vendor lock-in. Arista, Cisco, and Juniper run similar RoCEv2 features on locked hardware with proprietary licensing. Community SONiC is open but ships no AI-hardened defaults, watchdog, or SLA. DriveNets DDC is a proprietary cell fabric, not an Ethernet NOS. OcNOS-DC delivers the complete system, validated open switches plus OcNOS-DC plus support under one contract, and runs one NOS across both service-provider and data-center roles. It runs on Broadcom silicon with lossless RoCEv2 (PFC, ECN, sub-millisecond DLB with Reactive Path Rebalance), PFC deadlock recovery, UEC 1.0 fabric-profile alignment, and a 24/7 SLA, with no lock-in.
Ultra Ethernet (UEC) 1.0 对 OcNOS AI Fabric 意味着什么?
当 Ultra Ethernet NIC 到来时,您今天采购的交换机应当能够延续使用,而在 OcNOS-DC 上正是如此。您的 fabric 现在即可在生产环境中运行获得完整支持的 RoCEv2 加 DCQCN 加 DLB,OcNOS-DC 跟随 UEC 1.0 fabric profile,将每条流并行分散到每一条路径上,而非将其固定到单一 ECMP 哈希,因此您可在无需更换 NOS 或硬件的情况下迁移到 UEC NIC。OcNOS-DC 与 UEC 1.0 fabric profile 对齐;对齐并非认证声明。请参见 Ultra Ethernet 深度解析.
RoCEv2 是什么,为什么需要无损以太网架构?
您的训练集合通信 AllReduce 和 AllGather 通过 RoCEv2 在 GPU 之间直接搬运数据,路径中不经过 CPU,而 RDMA 从不重传,因此单个丢失的报文就会让该操作在任务的每一块 GPU 上重新开始。这正是生产级 RoCEv2 需要真正无损架构(PFC 加 ECN)的原因,OcNOS-DC 随附针对 RDMA 集合通信流量调优的 RoCEv2 缓冲配置和 DCQCN 默认值,让您的团队无需从零构建这种无损行为。
How does OcNOS-DC keep the fabric lossless, and what protects against PFC deadlock?
三种机制:PFC 在缓冲区溢出前按优先级暂停流量;ECN 提前标记报文以让发送端减速;ETS 让 RDMA 流量优先于较低优先级流量。在此之上,按端口、按优先级的 deadlock watchdog 会检测暂停队列的循环,并在作业挂起前自动清空队列:过去这种故障模式曾迫使在作业中途对交换机进行电源重启。PFC over L3 在路由边界之间同样受支持。
什么是 DLB,OcNOS 路线图上的 GLB 又是什么?
在 AllReduce 过程中,当标准 ECMP 在整个生命周期内将每条大流固定绑定到单条上行时,最大的几条流会相互碰撞,同步则被卡在拥塞链路上等待。DLB 读取 ASIC 队列深度的实时遥测数据,在不到一毫秒内将 flowlet 重新绑定到负载更轻的路径,因此如今就能在本地跳恢复被浪费的吞吐量。GLB 已列入 OcNOS 7.x 路线图,将同样的理念扩展到整个 fabric:spine 将路径质量遥测数据回传给入口 leaf,使路由能够在数千 GPU 的大型集群中对完整的多跳路径进行评分。
OcNOS AI Fabric 支持何种规模、以及哪些参考设计已通过验证?
OcNOS-DC 支持 400G 与 800G 的 leaf-spine fabric。 Tomahawk 5 spine 交换机(Edgecore AIS800-64D、UfiSpace S9321-64E)提供 51.2 Tbps / 64 × 800G; Tomahawk 4 leaves run 400G / 25.6 Tbps with on-chip buffering; Trident 4 covers smaller 100G/400G fabrics. Reference designs cover rail-only, rail-optimized, and 3-stage Clos topologies for large multi-thousand-GPU clusters: see the AI fabric 拓扑深度解析.
OcNOS-DC 是否支持面向 AI 架构运维的自动化与遥测?
是的。DCBX 自动完成服务器到交换机的 RoCEv2 配置,ZTP(IPv4/IPv6)处理零接触上线,gNMI 通过 OpenConfig YANG 流式推送变更触发的遥测数据。PFC 暂停、ECN 标记、DCQCN 阈值和缓冲深度均为 gNMI 传感路径,可由 Prometheus、InfluxDB、Telegraf、Grafana 或任何 OpenTelemetry 管线消费。Ansible playbook 覆盖 Day-0 至 Day-2,Terraform provider 已列入路线图。IP Maestro 作为 OcNOS 的网元管理系统,通过 NETCONF 管理拓扑、故障、配置和软件镜像,并可从一个控制台管理大规模多站点设备群。
OcNOS AI fabric 支持哪些交换机硬件与 800G 光模块?
The fabric runs on validated Broadcom Tomahawk 4 and 5 switches from Edgecore and UfiSpace. The 800G spines (Edgecore AIS800-64D and UfiSpace S9321-64E, Tomahawk 5, 64 x 800G QSFP-DD800, 51.2 Tbps) break out to 400G, 200G, and 100G; the 400G leaf (Edgecore AS9736-64D, Tomahawk 4, 64 x 400G QSFP56-DD, 25.6 Tbps with on-chip buffering) breaks out to 100G and 25G. Optics have proven interoperability from multiple vendors, so contact us for the transceiver list for your build. The switch platforms are listed in the HCL.
AI fabric 由谁提供支持,硬件是否也在覆盖范围内?
一份 IP Infusion 合同即可同时涵盖 OcNOS-DC 软件与经过验证的交换机硬件,因此只需对接一个 TAC 和一份 SLA。支持服务分为多个等级:Standard 包含邮件 TAC、工作时间电话支持与硬件 RMA 协调,P1 响应时间为 8 小时;Premium 增加 24/7 客户支持门户,P1 响应时间为 2 小时;Enterprise 进一步提供 30 分钟 P1 响应,并配备客户成功经理。24/7 门户面向 Premium 与 Enterprise 等级提供。