AI fabric 设计工具
端到端、厂商中立地设计无阻塞的 RoCEv2 GPU fabric。对 leaf 和 spine 交换机进行选型,规划光模块和线缆数量,针对您的集群比较 InfiniBand 与 Ethernet,并获取 lossless 拥塞配置。本工具仅进行网络设计,不提供成本估算或物料清单。
为 GPU fabric 定量
选择一个起始规模,或输入您自己的GPU数量、端口速率和交换芯片。该工具可对折叠式两层leaf-spine pod进行规模测算,并在集群跨入三层规模时予以提示。
…
上述数量假设采用折叠式 leaf-spine (Clos) fabric,每个 GPU 配备一块 fabric NIC,每个 leaf 将其端口在 GPU 与 spine 上行链路之间分配。rail-optimized 布线(每个 GPU 多块 NIC)改变的是流量的局部性,而非这些交换机数量。请参见 AI fabric拓扑参考设计 适用于 rail-optimized 和三层布局。
组件摘要
针对已定量设计的 fabric 链路、收发器和线缆数量。这些仅为规划数据,并非物料清单、报价或定价。
| Component | Basis | Quantity |
|---|---|---|
| 面向 GPU 的链路 | GPUs × 1 NIC | … |
| leaf到spine的fabric链路 | leaves × uplinks | … |
| fabric 光模块 | links × 2 ends | … |
| fabric线缆 | 每条链路 1 个 | … |
按传输距离选择的介质,视布线情况而定:最长 3 m 采用 DAC 或 AEC,最长 50 to 100 m 采用 AOC 或 SR,最长 500 m 采用 DR(主力选择),最长 2 km 采用 FR。仅列出传输距离等级。不含价格、SKU 或厂商料号。在三层设计中,请在上述数量之外,额外加入 spine 至 super-spine 的链路。
InfiniBand 与以太网对比
这是一份涵盖六个因素的厂商中立评分卡。它会根据您的输入显示每个因素倾向于哪一方及其原因。此处按设计并无唯一赢家。请将其用作设计评审的输入依据,而非最终建议。
| Factor | InfiniBand | Ethernet / RoCEv2 | Ultra Ethernet (trajectory) |
|---|---|---|---|
| 峰值性能倾向 InfiniBand | 以较低的调优投入即可获得百分之十五左右的原始吞吐量优势,另外还有 SHARP 网络内归约,可将集合操作从 GPU 卸载。 | Matches InfiniBand with proper tuning. Meta has described training its largest models on a 24,000-GPU RoCEv2 Ethernet cluster in production. The gap is tuning effort, not the ceiling. | 增加 packet spray 和 NIC 侧重排序,以降低尾部延迟并减少对 PFC 的依赖,从而缩小开箱即用的差距。 |
| Cost偏向 Ethernet | 在 fabric 规模下会带来明显的溢价,相较于同等 Ethernet 通常处于 30 至 60 个百分点的区间。 | merchant-silicon交换机加上广泛的光模块供应链,通常使其成为每端口成本更低的fabric。 | 与Ethernet相同的开放merchant silicon经济性。 |
| 开放性偏向 Ethernet | 从交换机、NIC到管理器端到端均为单一厂商栈,因此多厂商采购受到限制。 | 开放且多厂商:来自众多供应商的基于标准的交换机、NIC和NOS,保留供应链选择的灵活性。 | 强化开放方向的行业联盟标准(UEC 1.0,2025 年)。 |
| 运维的简洁性neutral | UFM提供单一的专用fabric管理器,对于不具备深厚RDMA人才的团队而言是一套开箱即用的方案。 | 可借助庞大的Ethernet人才储备和标准工具,但lossless RoCEv2需要审慎的端到端调优。 | 旨在减轻调优负担,使 Ethernet 趋向类似 IB 的开箱即用表现。 |
| 多租户与融合偏向 Ethernet | 通常是一个专用的后端孤岛,不具备原生多租户隔离或存储融合能力。 | 单一收敛的 Ethernet fabric 即可在标准租户隔离下承载后端、存储与前端流量。 | 在单一开放fabric上延展converged-Ethernet的方向。 |
| Trajectory偏向 Ethernet | 成熟稳定,在低调优下即具备领先性能,但受制于单一厂商的路线图。 | 至 2025 年年中,Ethernet 已转而主导 AI back-end 部署,并获得广泛的生态系统动能。 | UEC 1.0 (2025) 是一项明确面向 AI 与 HPC back-end fabric 的多厂商规范。 |
假设条件:性能是在完成调优的前提下进行比较(未调优的 Ethernet 表现落后,充分调优的 Ethernet 可达到同等水平);成本以区间形式给出,而非具体金额;开放性指多厂商采购,而非质量评判;Ultra Ethernet 反映的是 2025 年及以后的方向,而非已出货产品。集合运算调优泛指 xCCL 类库。以上内容用于辅助决策;fabric 选择请与 IP Infusion 工程师共同验证。
RoCEv2 lossless 配置
RoCEv2 并非单一的交换机特性。它是由 PFC、ECN 和 ETS 组成的配置组合,其中 DCQCN 承担稳态工作,PFC 作为兜底机制。本工具会针对您的设计推荐相应机制及其应用顺序。它不会给出阈值数值,也不会对任何设备进行操作。
| Mechanism | 在 lossless 配置中的作用 | OcNOS 可用性 |
|---|---|---|
| PFC | 为 RoCE 类别提供无丢弃保证。这是最后的兜底机制,而非主要的控制手段。 | 全部 4 个 AI 平台 |
| ECN | 提前标记拥塞,使发送方在队列溢出前降低速率。将其标记点调至 PFC 触发点以下。 | 全部 4 个 AI 平台 |
| DCQCN (ECN + PFC) | 稳态下的主要控制手段。ECN 标记驱动 NIC 侧的 DCQCN 反应,PFC 予以兜底。它是复合机制,而非独立功能。 | 全部 4 个 AI 平台 |
| ETS | 提供带宽保证与类别隔离,使 lossless 类别不会因 best-effort 流量而资源匮乏。 | 全部 4 个 AI 平台 |
| PFC 死锁看门狗 | 检测并解除PFC pause死锁或风暴状况,是PFC后备机制的安全网。 | 全部 4 个,OcNOS 7.0 |
| DLB (动态负载均衡) | Spreads elephant RoCE flows that collide under static ECMP, targeting utilization above 90 percent on the same switches. | 全部 4 个 AI 平台 |
| 动态 ECN | 根据实时队列状况调整 ECN 标记,随着负载变化减少人工重新调优。 | 仅限TH5,OcNOS 7.0 |
| DLB 反应式 / 随机 | 用于实现更紧密流量分散的高级 DLB 放置模式。在 TH4 上,请使用标准 DLB。 | 仅限TH5,OcNOS 7.0 |
| GLB (Global Load Balancing) | 超越本地 DLB 决策的 fabric 全局负载均衡。 | 路线图,OcNOS 7.1版本序列 |
| Ultra Ethernet | 采用 NIC 侧重排序并降低 PFC 依赖的 packet spray,这是通往 lossless AI Ethernet 的发展路径。 | 路线图、UEC 配置文件 |
仅供参考。这些建议不会下发至任何设备,此处也不会生成任何阈值。可用性以 OcNOS-DC 为准。 功能矩阵 and 硬件兼容性列表。请在部署前针对您所选的平台和 OcNOS 版本进行验证。
fabric 功耗
经过规模测算的设计中,fabric 交换机的典型功率范围。仅为范围值,且为满载光模块的情形。网络交换机仅占集群总功耗的一小部分,功耗主要由 GPU 主导。
散热:后门散热或直接液冷通常在每机架约 30 至 40 kW 以上时才会考虑,这取决于 GPU 服务器密度,而非网络。此为参考指引,并非计算得出的热负载。交换机功耗范围为已装配光模块的 51.2T (Tomahawk 5) 和 25.6T (Tomahawk 4) 级别设备的典型值;请以各平台数据手册中的确切数值为准。
匹配的 OcNOS-DC 平台
该 fabric 在开放的 Broadcom Tomahawk 硬件上运行单一 OcNOS-DC 镜像。以下是其设计所面向的受支持 800G 与 400G 平台。




本工具仅提供用于规划的结构性网络设计估算。它不构成性能保证、物料清单或成本估算。实际设计取决于 rail 优化、每 GPU 的 NIC 数量、布线以及故障域选择。GPU 数量为基于 Clos radix 计算的参考设计上限值,而非实测值。Broadcom 和 Tomahawk 是 Broadcom Inc. 的商标;其他名称为其各自所有者的商标。
AI Fabric参考设计
获取参考设计 PDF:包含拓扑、交换机数量、组件汇总,以及一份 RoCEv2 lossless 初始配置文件。
AI Fabric参考设计
简短表单:提交后 PDF 将立即开始下载。
✓ 正在新标签页中打开您的 PDF……
如果未能自动打开,请使用下方链接。
常见问题
如何为 GPU 集群规划 leaf-spine fabric 的规模?
什么是rail-optimized拓扑?
一个 AI fabric 需要多少个光模块?
对于 AI 而言,RoCEv2 与 InfiniBand 哪个更优?
如何为 RoCEv2 打造 lossless 的 AI fabric?
同一套 OcNOS 镜像是否可在 fabric 中的每台交换机上运行?
用 OcNOS 设计整张 AI fabric
从商业论证到端口数量测算,无论您进行到哪一步,都可从此接续。