基于标准 Ethernet 的开放 800G AI fabric
You can build a production GPU-cluster fabric on standard Ethernet and keep your NIC, GPU, and switch choices open. IP Infusion delivers that fabric complete: validated 800G open switches from Edgecore or UfiSpace running OcNOS-DC, supported under one contract. It carries lossless RoCEv2 RDMA with PFC, ECN-based congestion control (DCQCN), and sub-millisecond DLB in production today. IP Infusion 是 Ultra Ethernet 联盟的贡献成员,OcNOS-DC 与 Ultra Ethernet 1.0 fabric profile.
thousandGPU 参考设计
下载架构简报
Four short downloads that go deeper than this page: the lossless AI fabric architecture, the full OcNOS-DC datasheet, the EVPN-VXLAN data center reference, and next-generation DCI with IPoDWDM.
OcNOS 800G 以太网无损 AI 网络
基于 Tomahawk 4/5 spine 的无阻塞 RoCEv2 网络:SKU 层级、经验证平台与部署架构。
获取简报EVPN-VXLAN 数据中心网络
开放的leaf-spine数据中心架构:EVPN Type-2和Type-5路由、分布式anycast网关、多租户VNIs。
获取简报基于 IPoDWDM 的下一代 DCI
省去转发器层:直接在路由器上运行相干 400G/800G ZR 与 ZR+ 光模块,实现数据中心互连。
获取简报OcNOS-DC 数据手册
完整的 OcNOS-DC 规格:EVPN-VXLAN 与 Ethernet for AI 功能集、软件 SKU、支持的硬件平台,以及解决方案订购指南。
获取数据手册哪些因素决定任务完成时间
在大规模场景下,真正重要的是任务完成的速度和 GPU 的利用率,而不是交换机吞吐量。每当集群暂停以进行同步时,空闲的 GPU 就会浪费算力,因此架构必须做到零丢包,并在拥塞刚出现的瞬间就作出响应。
OcNOS-DC exposes every setting, so your team tunes the fabric against your real GPU collective traffic (xCCL: NCCL, RCCL, oneCCL) instead of accepting a vendor's fixed profile. Each pattern below is one way a cluster stalls, and how OcNOS-DC keeps it moving.
→ DLB 在一毫秒内将流量切换至更空闲的路径。
→ GLB is on the OcNOS roadmap to balance across the whole fabric, not just the local hop.
→ DCQCN 在任何缓冲区溢出之前,就提前减缓发送端速率。
→ PFC watchdog 可自动清除卡滞的端口。
→ Ultra Ethernet(UEC 1.0) 将单条流同时分散到每条路径上。
→ 今天采购的交换机在 UEC NIC 到来时可继续沿用,无需更换。
Where the capacity goes. Static ECMP pins each large flow to one path, so elephant flows collide on a few uplinks while others sit idle. Dynamic load balancing rebinds flows on real-time congestion to keep every uplink busy, so a well-run AI fabric targets utilization in the 90% range on the same switches, with no extra uplinks. OcNOS-DC ships DLB on Tomahawk 4 and 5.
DLB 深度解析 →800G spine-leaf, 端到端无损
这正是您团队已经熟悉的叶脊(Clos)设计,专为无损运行 GPU 流量而构建:路由式 eBGP 底层将流量均匀分散到每一条路径上,无损优先级队列保护 RoCEv2 流,独立的管理网络则自行启用交换机并流式传输遥测数据。用于检查点与数据集、挂接于叶节点的 NVMe-oF 与 NFS 存储紧邻 GPU 机架;请参见 DC 网络 for storage-fabric detail. Hover any node for platform, port count, and chip.

悬停节点以查看能力与平台详情 · 完整 HCL:40+ 款已验证平台,位于 ipinfusion.com/hcl
Every GPU NIC on its own rail, scaling across pods
In a rail-optimized fabric each GPU server homes one NIC to each of eight dedicated rail leaves, so the dominant same-rail AllReduce stays on one leaf and only cross-rail traffic reaches the spine. It scales pod by pod on the same 800G Tomahawk 5 switches. See the rail-optimized deep-dive and the full reference topologies.

经验证的开放交换机
OcNOS-DC 运行于来自 Edgecore 与 UfiSpace 的 Broadcom Tomahawk 和 Trident 交换机之上,因此每个平台都经过验证、可下单采购并具备第二货源。

Edgecore AIS800-64D
64 x 800G · 51.2 Tbps
QSFP-DD800 · 拆分为 2x400G / 4x200G / 8x100G
Datasheet →
UfiSpace S9321-64E
64 x 800G · 51.2 Tbps
QSFP-DD800 · 拆分为 2x400G / 4x200G / 8x100G
Datasheet →
Edgecore AS9736-64D
64 x 400G · 25.6 Tbps
QSFP56-DD 400G · 拆分为 4x100G / 4x25G · DAC / AOC
Datasheet →Broadcom Tomahawk 与 Trident 系列有何不同,以及 OcNOS 运行的所有开放交换机 →
软件、硬件与支持均由同一家厂商负责
一份合同,一个团队响应
一份 IP Infusion 合同即可同时涵盖 OcNOS-DC 软件与经过验证的交换机硬件,因此只需对接一个 TAC 和一份 SLA,无需分别面对 NOS 与硬件供应商。Premium 与 Enterprise 等级提供 24/7 支持门户。
查看支持详情统一管理 fabric 的单一控制台
IP Maestro 是面向 OcNOS 的网元管理系统:通过 NETCONF 管理每台交换机的拓扑、故障、配置和软件镜像,位于您现有 OSS 之下。从一个控制台管理大型多站点设备群。
了解 IP Maestro流式遥测与零接触部署
gNMI 流式遥测将数据送入 Prometheus 与 Grafana,DCBX 自动向每台服务器下发正确的无损配置,零接触部署则让交换机在启动时即完成配置并上线。
探索自动化面向 NVIDIA Spectrum-X 的开放、多厂商替代方案
OcNOS-DC 在来自多家开放硬件厂商的标准以太网交换机上运行无损 RoCEv2 AI fabric,置于同一份支持合同之下。它匹配 AI 训练作业所依赖的 fabric 机制,同时使 NIC、GPU 和硬件的选择保持开放,而非锁定于单一厂商。
| 决定成交的因素 | 开放式 AI Fabric(运行于 Edgecore / UfiSpace 上的 OcNOS-DC) | 封闭的单一厂商堆栈(NVIDIA Spectrum-X) |
|---|---|---|
| 硬件采购 | 来自多家厂商的开放通用芯片(Edgecore、UfiSpace) | 单一厂商交换机、NIC 与 GPU |
| NIC 和 GPU 选择 | 开放:可独立更换 NIC 与 GPU | 受制于 NVIDIA NIC 与 GPU 路线图 |
| 无损 RoCEv2(PFC、ECN、DCQCN) | ✓ details → | ✓ |
| 自适应负载均衡 | ✓ sub-millisecond DLB flowlet rebinding details → | ✓ (proprietary) |
| PFC 死锁保护 | ✓ deadlock watchdog with auto-drain details → | ✓ |
| Ultra Ethernet(UEC 1.0) | ✓ tracks the UEC 1.0 fabric profile details → | Aligned; also a UEC contributing member |
| 流式遥测与自动化 | ✓ gNMI, OpenConfig, ZTP, DCBX, Ansible | ✓ (vendor pipeline) |
| 单一支持合同(交换机与软件) | ✓ 一个 TAC,一个 SLA | ✓ (single vendor) |
| GPU 芯片后端集成 | 标准以太网;无 GPU 芯片协同设计 | Advantage NVIDIA: NIC, switch, and GPU co-designed |
| Fabric 控制器层 | 通过 gNMI 遥测以及您的 OSS 或 IP Maestro 进行管理 | Advantage NVIDIA: integrated fabric-controller layer |
| UEC certification | 与 UEC 1.0 fabric 规格保持一致(非认证声明) | NVIDIA 是 UEC 指导成员 |
NVIDIA、Spectrum-X、Quantum 和 ConnectX 是 NVIDIA Corporation 的商标。IP Infusion 与 NVIDIA 无关联,也不为其背书;此对比反映的是可在以下资源中验证的 OcNOS-DC 能力: 功能矩阵.
OcNOS-DC 的定位
到 2026 年,几乎每种方案都达到了相同的技术标准:无损 RoCEv2、拥塞控制、自适应路由、Ultra Ethernet 对齐。因此决策最终归结为 合作条款的形态:开放的操作系统还是封闭的技术栈,开放的硬件还是封闭的硬件,标准 Ethernet 还是封闭的 InfiniBand。 Here is where each one leaves you.
每种方案的侧重点各不相同。OcNOS-DC 的优势在于开放硬件、完整方案以及无锁定。
数分钟内完成 GPU fabric 规模规划
输入 GPU 数量与 NIC 速率。AI Fabric Design Suite 会据此生成 leaf-spine 拓扑、交换机与端口数量,以及可直接用于询价的物料清单。无需电子表格。
将 OcNOS 扩展至整个数据中心
AI 只是数据中心的一个环节。同一套 OcNOS 镜像可延伸至计算、存储与远端站点:同一 NOS、同一 CLI、同一支持体系。
常见问题
AI Fabric参考设计
Quick form. Your PDF opens immediately after submit.
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
OcNOS 800G 以太网无损 AI 网络
简短表单。提交后 PDF 将立即开始下载。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
EVPN-VXLAN 数据中心网络
简短表单。提交后 PDF 将立即开始下载。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
基于 IPoDWDM 的下一代 DCI
简短表单。提交后 PDF 将立即开始下载。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
AI fabric 与 DC 部署
在 Broadcom Tomahawk 4/5 上运行 OcNOS-DC 的生产级 AI 集群与数据中心 fabric。

NTT DATA 与 IP Infusion 合作,将解耦的开放网络解决方案推向市场,提供基于 OcNOS 的蜂窝站点路由器、Routed……

Scott Data 采用来自 UfiSpace、Edgecore Networks 与 Celestica 的开放网络硬件部署 OcNOS,替换了其原有的传统厂商堆栈……

Madeo Consultant 是一家位于法国的数据中心系统集成商,已用 IP Infusion OcNOS 替换了运行于 Edgecore 上的 Cisco Nexus 与 Catalyst 交换机……

Prosoluce 是一家法国 ISP 及托管服务提供商,已将其核心网升级为运行 IP Infusion OcNOS 的 100G EVPN-VXLAN 骨干网……
博客相关内容
AI 网络决策框架:兼顾速度、ROI 与战略自由的 GPU Fabric
面向采用 RoCEv2 与开放硬件的 GPU fabric 决策的买方侧框架
阅读全文 →面向数据中心的 OcNOS 7.0:AI Fabric、800G 平台、大规模 EVPN-VXLAN
OcNOS 7.0 中交付的 800G AI fabric 功能与 Tomahawk 5 平台
阅读全文 →OcNOS 7.0: What's New for AI, Transport, and Cloud
重点介绍面向 GPU 集群、采用 PFC 的 RoCEv2 无损传输
阅读全文 →面向数据中心的 OcNOS 6.6:AI Fabric PFC/ETS、EVPN 策略、400G
支撑 OcNOS AI fabric 部署的 PFC/ETS 无损 DCB 功能
阅读全文 →用 OcNOS 设计整张 AI fabric
从商业论证到端口数量测算,无论您进行到哪一步,都可从此接续。
需要我们联系您吗?
请留下您的联系方式,IP Infusion 团队将很乐意帮助您设计 AI 网络架构。我们仅在您希望时才会与您联系。