AI fabric 设计工具

端到端、厂商中立地设计无阻塞的 RoCEv2 GPU fabric。对 leaf 和 spine 交换机进行选型,规划光模块和线缆数量,针对您的集群比较 InfiniBand 与 Ethernet,并获取 lossless 拥塞配置。本工具仅进行网络设计,不提供成本估算或物料清单。

Step 1

为 GPU fabric 定量

选择一个起始规模,或输入您自己的GPU数量、端口速率和交换芯片。该工具可对折叠式两层leaf-spine pod进行规模测算,并在集群跨入三层规模时予以提示。

SPINE Spine 1Spine 2Spine 3 LEAF Leaf 1Leaf 2Leaf 3Leaf 4 GPU SERVERS
leaf 交换机
spine交换机
交换机总数

上述数量假设采用折叠式 leaf-spine (Clos) fabric,每个 GPU 配备一块 fabric NIC,每个 leaf 将其端口在 GPU 与 spine 上行链路之间分配。rail-optimized 布线(每个 GPU 多块 NIC)改变的是流量的局部性,而非这些交换机数量。请参见 AI fabric拓扑参考设计 适用于 rail-optimized 和三层布局。

Step 2

组件摘要

针对已定量设计的 fabric 链路、收发器和线缆数量。这些仅为规划数据,并非物料清单、报价或定价。

ComponentBasisQuantity
面向 GPU 的链路GPUs × 1 NIC
leaf到spine的fabric链路leaves × uplinks
fabric 光模块links × 2 ends
fabric线缆每条链路 1 个

按传输距离选择的介质,视布线情况而定:最长 3 m 采用 DAC 或 AEC,最长 50 to 100 m 采用 AOC 或 SR,最长 500 m 采用 DR(主力选择),最长 2 km 采用 FR。仅列出传输距离等级。不含价格、SKU 或厂商料号。在三层设计中,请在上述数量之外,额外加入 spine 至 super-spine 的链路。

Decision

InfiniBand 与以太网对比

这是一份涵盖六个因素的厂商中立评分卡。它会根据您的输入显示每个因素倾向于哪一方及其原因。此处按设计并无唯一赢家。请将其用作设计评审的输入依据,而非最终建议。

FactorInfiniBandEthernet / RoCEv2Ultra Ethernet (trajectory)
峰值性能倾向 InfiniBand以较低的调优投入即可获得百分之十五左右的原始吞吐量优势,另外还有 SHARP 网络内归约,可将集合操作从 GPU 卸载。Matches InfiniBand with proper tuning. Meta has described training its largest models on a 24,000-GPU RoCEv2 Ethernet cluster in production. The gap is tuning effort, not the ceiling.增加 packet spray 和 NIC 侧重排序,以降低尾部延迟并减少对 PFC 的依赖,从而缩小开箱即用的差距。
Cost偏向 Ethernet在 fabric 规模下会带来明显的溢价,相较于同等 Ethernet 通常处于 30 至 60 个百分点的区间。merchant-silicon交换机加上广泛的光模块供应链,通常使其成为每端口成本更低的fabric。与Ethernet相同的开放merchant silicon经济性。
开放性偏向 Ethernet从交换机、NIC到管理器端到端均为单一厂商栈,因此多厂商采购受到限制。开放且多厂商:来自众多供应商的基于标准的交换机、NIC和NOS,保留供应链选择的灵活性。强化开放方向的行业联盟标准(UEC 1.0,2025 年)。
运维的简洁性neutralUFM提供单一的专用fabric管理器,对于不具备深厚RDMA人才的团队而言是一套开箱即用的方案。可借助庞大的Ethernet人才储备和标准工具,但lossless RoCEv2需要审慎的端到端调优。旨在减轻调优负担,使 Ethernet 趋向类似 IB 的开箱即用表现。
多租户与融合偏向 Ethernet通常是一个专用的后端孤岛,不具备原生多租户隔离或存储融合能力。单一收敛的 Ethernet fabric 即可在标准租户隔离下承载后端、存储与前端流量。在单一开放fabric上延展converged-Ethernet的方向。
Trajectory偏向 Ethernet成熟稳定,在低调优下即具备领先性能,但受制于单一厂商的路线图。至 2025 年年中,Ethernet 已转而主导 AI back-end 部署,并获得广泛的生态系统动能。UEC 1.0 (2025) 是一项明确面向 AI 与 HPC back-end fabric 的多厂商规范。

假设条件:性能是在完成调优的前提下进行比较(未调优的 Ethernet 表现落后,充分调优的 Ethernet 可达到同等水平);成本以区间形式给出,而非具体金额;开放性指多厂商采购,而非质量评判;Ultra Ethernet 反映的是 2025 年及以后的方向,而非已出货产品。集合运算调优泛指 xCCL 类库。以上内容用于辅助决策;fabric 选择请与 IP Infusion 工程师共同验证。

配置文件

RoCEv2 lossless 配置

RoCEv2 并非单一的交换机特性。它是由 PFC、ECN 和 ETS 组成的配置组合,其中 DCQCN 承担稳态工作,PFC 作为兜底机制。本工具会针对您的设计推荐相应机制及其应用顺序。它不会给出阈值数值,也不会对任何设备进行操作。

Mechanism在 lossless 配置中的作用OcNOS 可用性
PFC为 RoCE 类别提供无丢弃保证。这是最后的兜底机制,而非主要的控制手段。全部 4 个 AI 平台
ECN提前标记拥塞,使发送方在队列溢出前降低速率。将其标记点调至 PFC 触发点以下。全部 4 个 AI 平台
DCQCN (ECN + PFC)稳态下的主要控制手段。ECN 标记驱动 NIC 侧的 DCQCN 反应,PFC 予以兜底。它是复合机制,而非独立功能。全部 4 个 AI 平台
ETS提供带宽保证与类别隔离,使 lossless 类别不会因 best-effort 流量而资源匮乏。全部 4 个 AI 平台
PFC 死锁看门狗检测并解除PFC pause死锁或风暴状况,是PFC后备机制的安全网。全部 4 个,OcNOS 7.0
DLB (动态负载均衡)Spreads elephant RoCE flows that collide under static ECMP, targeting utilization above 90 percent on the same switches.全部 4 个 AI 平台
动态 ECN根据实时队列状况调整 ECN 标记,随着负载变化减少人工重新调优。仅限TH5,OcNOS 7.0
DLB 反应式 / 随机用于实现更紧密流量分散的高级 DLB 放置模式。在 TH4 上,请使用标准 DLB。仅限TH5,OcNOS 7.0
GLB (Global Load Balancing)超越本地 DLB 决策的 fabric 全局负载均衡。路线图,OcNOS 7.1版本序列
Ultra Ethernet采用 NIC 侧重排序并降低 PFC 依赖的 packet spray,这是通往 lossless AI Ethernet 的发展路径。路线图、UEC 配置文件

仅供参考。这些建议不会下发至任何设备,此处也不会生成任何阈值。可用性以 OcNOS-DC 为准。 功能矩阵 and 硬件兼容性列表。请在部署前针对您所选的平台和 OcNOS 版本进行验证。

Estimate

fabric 功耗

经过规模测算的设计中,fabric 交换机的典型功率范围。仅为范围值,且为满载光模块的情形。网络交换机仅占集群总功耗的一小部分,功耗主要由 GPU 主导。

kW 典型低值
kW(满载)

散热:后门散热或直接液冷通常在每机架约 30 至 40 kW 以上时才会考虑,这取决于 GPU 服务器密度,而非网络。此为参考指引,并非计算得出的热负载。交换机功耗范围为已装配光模块的 51.2T (Tomahawk 5) 和 25.6T (Tomahawk 4) 级别设备的典型值;请以各平台数据手册中的确切数值为准。

匹配的 OcNOS-DC 平台

该 fabric 在开放的 Broadcom Tomahawk 硬件上运行单一 OcNOS-DC 镜像。以下是其设计所面向的受支持 800G 与 400G 平台。

本工具仅提供用于规划的结构性网络设计估算。它不构成性能保证、物料清单或成本估算。实际设计取决于 rail 优化、每 GPU 的 NIC 数量、布线以及故障域选择。GPU 数量为基于 Clos radix 计算的参考设计上限值,而非实测值。Broadcom 和 Tomahawk 是 Broadcom Inc. 的商标;其他名称为其各自所有者的商标。

资源

AI Fabric参考设计

获取参考设计 PDF:包含拓扑、交换机数量、组件汇总,以及一份 RoCEv2 lossless 初始配置文件。

下载 PDF
常见问题

常见问题

如何为 GPU 集群规划 leaf-spine fabric 的规模?
在非阻塞的两级leaf-spine fabric中,每台leaf交换机将一半端口用于GPU,另一半用于spine上行链路。leaf交换机的数量为GPU数量除以每台leaf面向GPU的端口数,spine交换机的数量则为在不产生超额订阅的情况下承载每条leaf上行链路所需的最少数量。单leaf集群无需spine层。本工具针对400G或800G的Broadcom Tomahawk 4和Tomahawk 5计算上述数量。
什么是rail-optimized拓扑?
rail-optimized 是指每台 GPU 服务器配备多块 NIC(通常为8块,每条 rail 一块),且每条 rail 各自归属于自己的 leaf,从而使各服务器上相同索引的 GPU 落到同一 leaf 上,占主导地位的 AllReduce 流量得以保持在本地。这是一种叠加在 1:1 无阻塞 fabric 之上的布线与流量局部性原则。它改变的是流量的走向,而非 leaf 与 spine 交换机的数量。
一个 AI fabric 需要多少个光模块?
每条点到点 fabric 链路两端各使用一个收发器,共两个,因此收发器数量为 leaf-to-spine 链路数量的两倍。链路数量等于 leaf 数量乘以其 uplink 数量,也等于 spine 数量乘以其 downlink 数量。本工具给出这些数量。它们仅为规划数据,并非物料清单或报价。
对于 AI 而言,RoCEv2 与 InfiniBand 哪个更优?
两者并非在所有情况下都更优。InfiniBand 在较低的调优投入下即可提供出色的原始性能,并配备统一的 fabric 管理器。采用 RoCEv2 的 Ethernet 在完成调优后即可达到同等性能,并通常在成本、开放性、多租户和行业趋势方面胜出。合适的 fabric 取决于集群规模、人员配置和现有技术栈。本工具会根据您的输入权衡各项因素,随后将决策交由设计评审处理。
如何为 RoCEv2 打造 lossless 的 AI fabric?
lossless RoCEv2 由三种协同工作的机制构成:用于 no-drop 类别的 PFC、用于早期拥塞信令的 ECN,以及用于类别隔离的 ETS。DCQCN 即 ECN 加 PFC,是稳态下的主要控制手段,而 PFC 则作为最后的兜底,因此应将 ECN 标记阈值调至 PFC 阈值以下。请保持 PFC、ECN 和 CoS 端到端一致。OcNOS-DC 在 Tomahawk AI 平台上支持这些机制。
同一套 OcNOS 镜像是否可在 fabric 中的每台交换机上运行?
是的。每台 leaf 与 spine 交换机都在开放的 Tomahawk 硬件上运行同一套 OcNOS-DC 镜像,具备 RoCEv2、PFC 和 ECN 以及动态负载均衡。无论设计最终需要多少台交换机,这都使 fabric 保持在同一套操作系统和同一份支持合同之下。
AI 网络

用 OcNOS 设计整张 AI fabric

从商业论证到端口数量测算,无论您进行到哪一步,都可从此接续。