OcNOS 7.1 路线图 · 端到端 · 叠加于 DLB 之上

Global Load Balancing:全网自适应路由

DLB 在单跳上做出正确决策;GLB 则在整张 fabric 范围内做出正确决策。 在 OcNOS 7.1 路线图中,Global Load Balancing 把自适应路由从按端口的视角扩展到端到端路径质量,弥合三级 Clos AI fabric(最高至 16,384-GPU 上限)上的多跳热点差距。GLB 叠加于 DLB 之上,而非取代它。

OcNOS 7.1GLB 目标版本
End-to-end路径评分,而非本地单跳
16,384GPU 上限,参考设计
叠加于 DLB 之上扩展,而绝非替代
端到端路径遥测

为整条路径评分,而不仅是本地单跳

一个承载 GPU AllReduce 的三级 Clos 切片(leaf、spine、super-spine)。每一层都把队列占用和链路利用率遥测向入口 leaf 回传。GLB 选择端到端评分最优的路径,而非本地出向评分最优的路径,因此一条通向拥塞下行链路的畅通上行链路不会再被盲目选中。

跨三级 Clos AI fabric 的全局负载均衡 三级 Clos AI 网络结构。顶层为两台 super-spine,中间为四台 spine,底层为两台 leaf。遥测箭头向上流动再向下回流,使入口 leaf 能够感知端到端路径质量。其中一条 spine 到 super-spine 的链路发生拥塞并被绕过,转而选用另一条端到端路径。 端到端遥测 Super-Spine-1TH5 · 51.2T Super-Spine-2TH5 · 51.2T Spine-1e2e ok Spine-2e2e ok Spine-3上行链路过热 Spine-4e2e ok 入口 LeafGLB · ranks paths 出口 Leaf目标机架 GLB · END-TO-END PATH SCORING · MULTI-HOP CONGESTION AWARENESS · OcNOS 7.1
本地视角失效之处

DLB 与 GLB,按路径决策的范围划分

DLB 利用本地出向队列深度为每个 ECMP 下一跳评分,这在两级 leaf-spine 上是最优的。扩展到三级 Clos 后,您可能选中一台上行链路畅通的 spine,却落到一台其回往出口 leaf 的下行链路已拥塞的 super-spine 上。本地视角是正确的,端到端视角却是错的。在 1,024-GPU 及更大的 fabric 上,当带 super-spine 的三级 Clos 成为标准时,这便是尾延迟离群值残余的主要来源。

Axis DLB本地,如今已发布 GLB全局,OcNOS 7.1 路线图
决策范围逐跳:每台交换机为自己的 ECMP 下一跳排序。端到端:入口 leaf 为完整的 leaf 到 leaf 路径排序。
Signal used本交换机上的本地出向队列深度和链路利用率。从每一层汇聚、回传至入口的拥塞遥测。
最佳匹配两级 fabric,以及三级中的 leaf 到 spine 跳。带 super-spine 的三级 Clos,最高至 16,384-GPU 上限。
可捕获的热点仅本地出向拥塞。本地单跳无法看到的下游热点。
Rebinding与 flowlet 对齐,对 RoCEv2 和 TCP 保持按序。与 flowlet 对齐,提供相同的按序保证,并以全 fabric 数据为输入。
硬件如今支持 TH4 和 TH5。同样的 TH4 和 TH5 硬件,无需新芯片。
Relationship每台交换机独立决策。叠加于 DLB 之上;并不取代它。
GLB 如何弥合差距

一次决策,由整张 fabric 提供依据

GLB 复用运营商已在运行的自适应路由机制,并在其上增加全 fabric 感知。它直接构建于 DLB 和 RoCEv2 之上,并与 Ultra Ethernet 的发展方向保持一致。

Builds on

DLB 决策

GLB 扩展了 DLB flowlet 决策,而非取代它。混合 fabric 可正常工作:在滚动升级期间,非 GLB 交换机只是贡献仅限本地的路径质量。

Runs over

一张无损 RoCEv2 fabric

GLB 在 flowlet 边界重新绑定,保持 RoCEv2 RDMA 所需的按序交付。传输保持生产级;只是路径输入变得更智能。

对齐于

Ultra Ethernet 信令

路径质量平面的设计目标是与 Ultra Ethernet 联盟信令互通(随着 UEC NIC 生态成熟),从而使路线图保持前向兼容。

深入 OcNOS 7.1

计划中的 GLB 实现如何协同运作

GLB 由作为网络操作系统的 OcNOS 在基于 Broadcom 的开放硬件上启用。该设计让控制平面保持安静,并为运营商提供信任 fabric 决策所需的遥测。

遥测平面

路径质量发布

每台 spine 和 super-spine 都把按端口的队列占用和利用率增量发布到一个全 fabric 的邻接关系中。更新通过现有的带内信令以亚毫秒级完成,且不产生额外的控制平面开销。

路径评分

端到端汇聚

入口 leaf 把本地出向质量与下游遥测合并为每条候选路径的综合评分。最差的一跳主导该评分,这与运营商排障时所用的直觉一致。

Selection

Flowlet-aligned

与 DLB 类似,GLB 在 flowlet 边界处重新绑定,从而为 RoCEv2 和 TCP 保持有序交付。区别在于决策依据:依据的是全 fabric 的质量,而非本地端口质量。

Backwards-compatible

叠加于 DLB 之上

GLB 扩展 DLB 决策,而非取代它。同时包含 GLB 能力交换机和仅 DLB 交换机的混合 fabric 也能正确运作,因此从 7.0 进行的存量升级是安全的。

Scale

最高可达 16k-GPU 上限

参考设计采用 256 台 spine 交换机和 128 台 super-spine 交换机,每台均为 64x800G 的 Tomahawk 5,按 16,384-GPU 架构上限设定规格。

遥测输出

面向运维团队的 gNMI

按路径评分、重绑定事件和最差跳归因通过 gNMI 和 OpenConfig 流式输出,因此 SRE 无需面对黑盒即可把 fabric 决策与 xCCL 集合通信作业行为关联起来。

路线图与可用性

GLB 落地时可期待什么

GLB 已列入 OcNOS 7.1 路线图。它面向运营商已在运行的同一套硬件和许可,因此采用它是一次升级,而非整机更换。

  • OcNOS 7.1 路线图。 GLB 面向 7.1 OcNOS-DC 版本系列,运行在如今运行 DLB 的同一套 TH4 和 TH5 硬件上。进度与功能范围见 OcNOS 版本发布页.
  • 同一 SKU。 计划纳入 OcNOS-DC PLUS:无按功能付费墙,升级时无需新的许可密钥。
  • 原地升级。 支持从 7.0 到 7.1 的存量升级;混合版本织构在升级窗口期间以仅 DLB 行为继续正常工作。
  • UEC-aligned. 路径质量平面的设计目标是在 UEC NIC 生态成熟后与 Ultra Ethernet 联盟信令互通。参见 Ultra Ethernet(UEC).
  • 可提供架构评审。 如果您正在为 1,000 个以上 GPU 的 fabric 设定规格,我们将进行一次涵盖 GLB 遥测平面的规格测算。用以下工具获取一版初步的 leaf-spine 布局: AI Fabric Design Suite.
IP Infusion 的观点

如今 DLB 是下限,接下来 GLB 抬高上限

自适应路由已在两级规模上解决真实的尾延迟问题。GLB 把同样的方法带入最大规模集群所在的三级 fabric,运行在您已经验证的开放硬件上。

DLB 解决常见情形

在两级 leaf-spine 以及 leaf 到 spine 的一跳上,本地自适应路由已消除大多数 ECMP 冲突。这如今已在 TH4 和 TH5 上发布。

GLB 解决大规模情形

在 1,024 个 GPU 及以上,多跳热点成为主要的离群因素。GLB 为完整路径评分,使入口 leaf 不再追逐一条通向拥塞下行链路的畅通上行链路。

OcNOS 是使能者

一套 NOS,一份功能路线图:如今 DLB,下一步 GLB,全程与 RoCEv2 和 UEC 对齐,运行在经过验证的开放硬件上,而非单一厂商 fabric。

常见问题

Global Load Balancing 常见问题解答

GLB 与 DLB 有何不同?
DLB 依据单台交换机的本地出口队列深度对每个下一跳进行评分,这在两级 leaf-spine 中表现最优。GLB 汇聚各级的拥塞遥测数据,使入口 leaf 能够对完整的 leaf 到 leaf 路径进行排序,从而捕捉本地视角在三级 Clos fabric 中遗漏的下游热点。
GLB何时可用?
GLB 已列入 OcNOS 7.1 路线图,面向 OcNOS-DC 版本系列,运行在如今运行 DLB 的同一套 Tomahawk 4 和 5 硬件上。计划纳入 OcNOS-DC PLUS SKU,升级时无需新的许可密钥。
使用 GLB 是否必须替换 DLB?
不。GLB是在DLB决策之上叠加运行,而非取而代之。混合fabric可正常工作:不支持GLB的交换机仅提供本地路径质量,并支持从7.0进行的brownfield升级。
GLB 支持多大规模的 fabric?
参考设计采用 256 台 spine 交换机和 128 台 super-spine 交换机,每台均为 64x800G 的 Tomahawk 5,按 16,384-GPU 架构上限设定规格。

在为数千 GPU 规模的 fabric 设定规格?让我们一起测算

告诉我们工作负载和 GPU 规模,IP Infusion 的工程师将与您一起为 GLB 遥测平面设定规格,或先在 AI Fabric Design Suite 中生成一版初步的 leaf-spine 布局。