首页/产品/OcNOS-DC
DC · AI Fabric · EVPN-VXLAN

OcNOS-DC: 数据中心网络操作系统。

面向 leaf-spine 数据中心 fabric 的开放网络操作系统。在经过验证的 Broadcom 开放硬件上提供 EVPN-VXLAN 叠加网络、面向 AI GPU 集群的无损 RoCEv2、ZTP 自动化以及流式遥测。

dc-spine01 · OcNOS-DC
$show bgp l2vpn evpn summary
BGP EVPN · AS 65001
邻居 状态 前缀
10.0.0.11 已建立 342
10.0.0.12 已建立 342
$show priority-flow-control statistics all
优先级 3 RoCEv2
丢弃数 0
状态 ✓ 无损
$show ztp status
状态 ✓ 完成
架构 ✓ EVPN 已加入
$
纵向扩展、横向扩展、跨域扩展

一张 fabric,任意距离。

OcNOS-DC 从三个方向扩展同一张 fabric:在 pod 内向上扩展、向外扩展到更宽的 Clos fabric,以及跨数据中心扩展,全部运行在统一的 EVPN 与 BGP 控制平面之下。

Scale-up

向上扩展 pod

提升每台交换机的带宽与端口密度,从 100G fabric 迁移到 400G 和 800G,使同一张 leaf-spine-super-spine pod 能够支撑更大、更高带宽的计算节点,而无需增加 pod。

OcNOS-DC · 100G 至 800G
Scale-out

向外扩展 fabric

增加更多相同的构建模块,即更多的 spine 与 super-spine 交换机以及 leaf 对,将 Clos 拓扑横向拓宽。更多机架与 leaf 得以接入,同时每个端点都保持 any-to-any 可达性,全部作为一张 EVPN 与 BGP fabric 进行管理。

OcNOS-DC · 更宽的 Clos,any-to-any
Scale-across

跨站点扩展

将 fabric 延伸到单个数据中心之外。全局 EVPN 与 BGP 控制平面通过长距相干互连,将相互独立的 DC pod 连接成一张逻辑上统一的 fabric。每个站点运行同一套 NOS。

OcNOS-DC · 多站点 DCI
架构

一套 NOS,覆盖每一层,覆盖每一个站点。

同一套 OcNOS-DC 运行数据中心内的每一张 fabric:AI 后端、存储、前端以及带外管理,全部运行在开放的 Broadcom 硬件上,采用统一的运维模式。一个镜像、一套 CLI、一条自动化工具链,贯穿每一层与每一个站点。

One OcNOS-DC NOS across the AI, storage, and management fabrics A reference OcNOS-DC data center. A 1:1 non-blocking AI back-end fabric and a 1:3 storage fabric both connect to the GPU servers, every switch runs OcNOS. An out-of-band management fabric on OcNOS reaches every tier: the AI fabric, the storage fabric, the frontend fabric, and the servers. RoCEv2, ECN and PFC, and DLB run across the back-end. 800G LEAF-SPINE · LOSSLESS RoCEv2 · DLB AI FABRICback-end (TH4, TH5)OcNOSSpine 1OcNOSSpine 2OcNOSSpine 3OcNOSSpine NOcNOSLeaf 1OcNOSLeaf 2OcNOSLeaf 3OcNOSLeaf N1:1800G STORAGE FABRICNVMe-oF / NFSOcNOSSpine 1OcNOSSpine 2OcNOSSpine 3OcNOSSpine NOcNOSLeaf 1OcNOSLeaf 2OcNOSLeaf 3OcNOSLeaf N1:3100G GPU SERVERS · POD 1 8 NIC per server · one per rail Server 1 GPU compute Server 2 GPU compute Server N GPU compute OOB MANAGEMENT CLOS / MLAG · reaches every tier OcNOSOOB 1 OcNOSOOB 2 FRONTEND FABRIC 3:1 · user-facing edge · separate plane same OcNOS image · 25G / 50G / 100G 400G 100G 1G 1G 1G OOB · 1G RoCEv2 ECN / PFC DLB 400 / 800G Scale-Out

一个 OcNOS 镜像即可运行 AI 后端、存储、前端与管理 fabric。 探索 AI Fabric

深入底层

fabric 究竟运行着什么。

让 AI 数据中心 fabric 运转的底层机制,构建于开放标准之上,而非专有黑盒。

无损 fabric

面向RDMA的无损RoCEv2

Priority Flow Control 仅暂停 RoCEv2 流量类别,ECN 配合 WRED 在队列填满之前标记报文,从而让 DCQCN 在源头限速发送方 GPU。PFC 看门狗可防范 pause-storm 死锁。最终为 xCCL 集合通信提供一张零丢包的 RDMA fabric。

PFC 802.1QbbECN / WREDDCQCNPFC watchdog
叠加网络

EVPN-VXLAN,与超大规模运营商所运行的 fabric 相同

MP-BGP EVPN 在 VXLAN 数据平面上承载 Type-2 MAC/IP 与 Type-5 IP 前缀路由,配合对称 IRB 与分布式 anycast 网关。All-active ESI 多归属为双归属的 GPU 与存储节点取代传统 MLAG,并按照 RFC 7432 与 RFC 8365 与其他厂商互通。

MP-BGP EVPNType-2 / Type-5对称 IRBESI multihoming
Day-0 自动化

新机架的零接触上线

Zero Touch Provisioning 利用 DHCP 选项 66 和 67 获取 OcNOS 镜像与 day-0 配置,因此新的 leaf 或 spine 无需 console 会话即可加入 fabric。模型驱动的接口可无缝接入现有的 Ansible、Terraform 或自研控制器流水线。

ZTP DHCP 66/67AnsibleNETCONF/YANGRESTCONF
可观测性

通过gNMI和gRPC的流式遥测

OcNOS-DC 通过 gNMI 与 gRPC dial-out 流式上报接口计数器、缓冲区占用、PFC pause 事件以及 BGP EVPN 状态,并以 OpenConfig 与原生 YANG 建模。这些数据为闭环保障与拥塞仪表盘供能,无需轮询 CLI。

gNMI / gRPCOpenConfigNative YANGDial-out
为何选择 OcNOS-DC

开放网络的经济效益。

与在位厂商相同的芯片,以开放条款采购。这是 OcNOS-DC 独立于技术之外的商业理由。

开放经济效益

相同的 Broadcom 芯片,不必缴纳专有溢价

OcNOS-DC 运行在开放的 Edgecore 与 UfiSpace 交换机上,这些设备采用与在位厂商产品内部相同的 Tomahawk 与 Trident 芯片,而每端口成本显著更低。硬件与软件按各自独立的周期采购与更新,而非捆绑于机箱生命周期。

开放 ODM 硬件 更低的每端口成本 独立的更新周期
如何采购
开放硬件

多厂商硬件,杜绝单一来源锁定

来自 Edgecore 与 UfiSpace 的 18 款经过验证的平台,从 25G leaf 到 800G spine。为硬件引入第二货源、在价格上保持主动权,而非从单一厂商同时采购交换机与软件。

统一的运维模式

一套 NOS 贯穿 leaf、spine 与 border

同一套 OcNOS 镜像、CLI 与自动化贯穿每一种角色,并覆盖运营商、数据中心与 AI-fabric 各类部署。一条工具链管理整张网络,而不是每台设备一套操作系统。

单一负责厂商

软件、硬件与 RMA 一份合同全包

一份 IP Infusion SLA 即涵盖 OcNOS-DC、经过验证的 Edgecore 或 UfiSpace 平台以及 RMA 物流。当链路在凌晨 3 点中断时,软件厂商与硬件厂商之间不会再互相推诿。

商用产品,而非 DIY

提供7x24小时TAC支持和路线图的商用NOS

OcNOS-DC 以商用产品交付,配备 24/7 TAC 与产品路线图。社区版 SONiC 要求你的团队自行承担集成、硬件验证与第三方支持。IP Infusion 则替你承担这部分工程开销。

选择您的 OcNOS-DC

SKU 与平台对比

OcNOS-DC 提供三个版本。所有版本均包含覆盖软件与硬件的 IPI 统一支持。

OcNOS-DC:数据中心交换机 DC-MGMT DC-IPBASE DC-PLUS
二层 / 三层
EVPN-VXLAN
面向 AI 的 Ethernet(RoCEv2 / PFC / ECN)
流式遥测 (gNMI/gRPC)
400G ZR/ZR+ 相干光 (DCI)
合格平台
ASIC容量端口速度 DC-MGMT DC-IPBASE DC-PLUS
TD3-X2128G1/10G
TD3-X52,000G10/25/100G
TD3-X73,200G10/25/100G
TH26,400G100G
TH312,800G400G
TD412,800G400G
TH425,600G400G
TH551,200G800G

*功能支持因平台而异。请参阅 功能矩阵 了解详情。现有 18 款合格 DC 平台可选。

每个 SKU 都包含完整的 DC 堆栈
EVPN-VXLAN对称 IRBBGP ECMP RoCEv2PFCECN WRED RDMAZTPgNMI/gRPC OpenConfigNETCONF/YANGAnsible 400G ZR+交换机上的 DockerRESTCONF
免费试用 合格平台 互动功能矩阵
对比分析

OcNOS-DC 与 Arista EOS / Cisco Nexus / NVIDIA Spectrum-X 对比

相同的 Broadcom 芯片。开放硬件。AI 网络无需支付专有税。

✕ Proprietary DC switching (Arista · Cisco · NVIDIA)
运行于专有硬件之上的专有 NOS:每次刷新都被厂商锁定
RoCEv2、PFC 调优等 AI fabric 特性被锁定在高端 SKU 或附加许可证之后
NVIDIA Spectrum-X 将 AI fabric 与 NVIDIA 的交换机、NIC 和 GPU 绑定在一起:整个技术栈依赖单一供应商
厂商专有的自动化:跨平台、跨代际的可移植性有限
相较开放 ODM 平台上等效的 Broadcom 芯片,硬件价格更高
许可证续订与更新周期被绑定在厂商的硬件节奏上
✓ OcNOS-DC on open Broadcom hardware
运行在 Edgecore 与 UfiSpace 开放硬件上的开放 NOS:多厂商硬件选择
完整的 RoCEv2 无损 AI fabric 已包含在 DC-IPBASE 中,无需附加组件
在开放的 Broadcom 交换机上运行 AI fabric,兼容任意 GPU 与 NIC 厂商:不存在单一供应商 AI 技术栈
基于 Linux 的开放 API:Ansible、NETCONF/YANG、gNMI、RESTCONF、交换机内 Docker
相同的 Broadcom 芯片,最高支持 Tomahawk 5:总体拥有成本大幅降低
一份 IP Infusion 支持合同即涵盖 OcNOS-DC 软件与经过验证的硬件

同时也是自研 SONiC 的替代方案。 OcNOS-DC 是一套商用 NOS,配备 24/7 TAC、单一厂商 SLA 与 RMA 物流。社区版 SONiC 为开源软件,要求你的团队自行承担集成、硬件验证与第三方支持,而这部分工程开销正是 IP Infusion 替你承担的。请参阅 OcNOS 与 SONiC 对比.

准备好部署 OcNOS-DC 了吗?

预约技术演示,或在我们的云实验室中免费试用:无需硬件。

常见问题

OcNOS-DC:常见问题

什么是 OcNOS-DC,它用于哪些场景?
OcNOS-DC是IP Infusion为OcNOS推出的数据中心版本。OcNOS这一网络操作系统已在60多个国家的600多家运营商投入生产运行。它专为承载EVPN-VXLAN叠加网络、面向AI和ML集群的无损RoCEv2流量以及400G或800G DCI链路的leaf-and-spine架构而构建。该操作系统运行在Edgecore和UfiSpace基于Broadcom的开放交换机上,为运营商提供了替代Arista EOS、Cisco Nexus和自建SONiC方案的商用选择。
OcNOS-DC 支持哪些 EVPN-VXLAN 特性?
OcNOS-DC实现了EVPN-VXLAN,同时支持Type-2 MAC/IP和Type-5 IP前缀路由、对称IRB、分布式anycast网关以及ARP抑制。采用全活ESI LAG的EVPN多归属,为双归属服务器和存储替代了传统MLAG。控制平面遵循RFC 7432和RFC 8365使用MP-BGP,因此可与其他厂商主流的EVPN实现互操作。
OcNOS-DC 如何为 AI 工作负载构建无损 RoCEv2 fabric?
OcNOS-DC 出厂即配备针对 RoCEv2 预调优的 Priority Flow Control(PFC)和 Explicit Congestion Notification(ECN)配置文件,因此 RDMA 流量类别可按优先级逐一暂停,从而避免 GPU 到 GPU 的丢包。其目标是为 NCCL 和 RCCL 等 xCCL collective 提供零丢包架构。迄今为止的实际生产部署规模约为 20 至 200 个 GPU,随着项目规模扩大,该设计可进一步扩展。
OcNOS-DC 有哪些许可层级?
OcNOS-DC 提供三种 SKU。DC-MGMT 为带外管理交换机提供二层和三层功能。DC-IPBASE 增加 EVPN-VXLAN overlay 和面向 AI 网络结构的无损以太网,DC-PLUS 在此基础上扩展了流式遥测以及面向数据中心互连的 400G ZR/ZR+ 相干光模块。
OcNOS-DC 可运行在哪些交换机和 Broadcom 芯片上?
OcNOS-DC 支持来自 Edgecore 与 UfiSpace 的 18 款开放硬件平台,覆盖范围从 48x25G ToR leaf 直至 64x800G spine。所支持的 Broadcom 芯片包括 Tomahawk 5(51.2T,800G)、Tomahawk 4(25.6T,400G)、Tomahawk 3、Trident 4 和 Trident 3。同一套 NOS 镜像贯穿整个产品线,因此运营商可以在 leaf、spine 与 border 各类角色上统一使用一套 CLI 与一条自动化工具链。
OcNOS-DC 如何处理自动化和零接触部署?
OcNOS-DC 北向暴露 NETCONF、RESTCONF 和 gNMI/gRPC,并提供 OpenConfig 和原生 YANG 模型,因此可无缝接入现有的 Ansible、Terraform 或自研控制器流水线。Zero Touch Provisioning 使用 DHCP 选项 66/67 获取镜像和初始配置,使新的 leaf 或 spine 无需 console 访问即可加入架构。流式遥测在 DC-PLUS 层级提供,用于实现闭环运维保障能力。
对于数据中心 fabric,scale-up、scale-out 与 scale-across 分别是什么?
这是 OcNOS-DC 扩展同一张 fabric 的三种方式。Scale-up 通过提升每台交换机的带宽与端口密度来扩展单个 pod 的容量,例如从 100G fabric 迁移到 400G 和 800G,使同一张 leaf-spine-super-spine 拓扑能够支撑更大、更高带宽的计算节点,而无需增加 pod。Scale-out 通过增加更多相同的构建模块来扩展容量,即更多的 spine 与 super-spine 交换机以及 leaf 对,将 Clos 拓扑横向拓宽,使更多机架与 leaf 得以接入,同时每个端点都保持 any-to-any 可达性。Scale-across 通过全局 EVPN 与 BGP 控制平面,经由长距相干互连,将相互独立的 DC pod 连接成一张逻辑上统一的 fabric,从而将 fabric 延伸到单个数据中心之外。OcNOS-DC 在一套 NOS 与一个控制平面之下同时运行这三种扩展方式。