DCQCN: control de congestión cuantizado para RDMA

DCQCN es el control de congestión en lazo cerrado que mantiene un fabric de IA RoCEv2 fuera de la pausa PFC y lejos de la pérdida de paquetes: el switch marca ECN de forma temprana, el receptor devuelve un CNP y el emisor cuantiza su tasa. OcNOS-DC incorpora valores predeterminados preajustados para cargas de trabajo colectivas xCCL (NCCL / RCCL / oneCCL) y expone cada umbral para fabrics que necesiten desviarse.

El lazo cerrado DCQCN

NIC emisora, switch congestionado, NIC receptora. Se activa el marcador WRED ECN del switch before la cola alcanza el umbral de pausa de PFC. El receptor genera un Congestion Notification Packet (CNP); el punto de reacción del emisor reduce la tasa y luego la incrementa de nuevo. Sin pérdidas, sin presión de PFC, convergencia rápida.

Control de congestión en lazo cerrado DCQCN Tres cajas de izquierda a derecha: NIC emisora (punto de reacción), switch congestionado con marcador WRED ECN, NIC receptora (punto de notificación). La flecha hacia adelante muestra un paquete que fluye de izquierda a derecha y que es marcado por el switch. La flecha inversa muestra el CNP viajando de derecha a izquierda de vuelta al emisor. Las etiquetas indican los umbrales ECN K-min, K-max y la ruta de retroalimentación del CNP. datos + con capacidad ECN ECN = CE (marcado) CNP: Paquete de notificación de congestión NIC emisoraPunto de reacciónα-update · cut · ramp Switch OcNOS-DCMarcador WRED ECNK-min · K-max · P-max NIC del receptorPunto de notificaciónCNP cada 50 µs DCQCN · MARCADO WRED · RETROALIMENTACIÓN CNP · LÍMITE DE TASA CUANTIZADO · RoCEv2 SIN PÉRDIDAS

La función que cumple DCQCN en un tejido de IA

RoCEv2 tiene dos formas de manejar la congestión: la pausa PFC (contrapresión que se propaga salto por salto) y DCQCN (un bucle de control de tasa de extremo a extremo). PFC por sí solo funciona, pero empuja la congestión aguas arriba y arriesga tormentas de pausa y bloqueo de cabecera de línea. DCQCN actúa antes que PFC, marcando los paquetes con ECN before la cola alcanza el umbral de pausa, de modo que el emisor reduce la velocidad antes de que el switch tenga siquiera que aplicar la pausa.

Bien hecho, pasará la mayor parte de la vida de su fabric solo con la retroalimentación de DCQCN, con PFC como red de seguridad de respaldo. Mal hecho, los umbrales de ECN están desalineados con el headroom de PFC y obtiene tormentas de pausa incluso con DCQCN configurado. El ajuste de umbrales lo es todo, y OcNOS-DC publica valores por defecto ajustados para tráfico colectivo xCCL, exponiendo cada parámetro para fabrics con patrones de tráfico específicos.

Los tres actores

  • Punto de reacción (NIC emisora). Recibe los CNP y ejecuta el bucle de DCQCN de actualización α / disminución multiplicativa / incremento aditivo para cuantizar su tasa de envío.
  • Punto de congestión (switch). Marca los paquetes con capacidad ECN para CE utilizando una curva WRED cuando la profundidad de la cola supera K-min, con la probabilidad de marcado aumentando linealmente hasta P-max en K-max.
  • Punto de notificación (NIC receptora). Genera un CNP de vuelta al emisor en cada flujo marcado, con límite de tasa (normalmente uno por cada 50 µs por flujo).

La implementación de DCQCN de OcNOS

Curva WRED

K-min, K-max, P-max

Marcado WRED ECN por cola de prioridad con umbrales K-min y K-max configurables y probabilidad de marcado P-max. Valores por defecto de clase xCCL listos para usar; expuestos como rutas YANG para ajuste.

Per-Priority

Independiente de PFC

El marcado de ECN se configura de forma independiente de los umbrales de pausa de PFC. La desalineación es el error de configuración de DCQCN más común. OcNOS valida la relación entre K-max, el headroom y las aserciones de pausa antes de aplicarla.

Compatible con VXLAN

ECN sobre VXLAN

Los bits ECN se preservan a través del encap/decap de VXLAN, de modo que DCQCN funciona de extremo a extremo sobre una superposición EVPN-VXLAN, y no solo sobre el underlay.

Telemetría

Contadores ECN por cola

Contadores transmitidos por gNMI de paquetes marcados con ECN por cola de salida, distribución de profundidad de cola y tasas de activación de CNP. Ajuste de lazo cerrado durante la puesta en marcha del clúster.

Diagnostics

Verifique antes de comprometerse

Verificación de coherencia por CLI de que K-min / K-max / margen de PFC son matemáticamente consistentes con el espacio de buffer asignado a la prioridad sin pérdidas. Falla rápido ante una configuración errónea.

Scope

Nivel de licencia DC-PLUS

Parte del SKU OcNOS-DC PLUS. La misma imagen, el mismo soporte; sin complementos por función para activar el stack RDMA sin pérdidas.

Por qué esto importa más de lo que parece

La mayoría de los casos de soporte del tipo «RoCEv2 no se comporta correctamente» se deben a una desalineación de los umbrales de DCQCN. O bien ECN está configurado pero nunca marca (K-min demasiado alto) y PFC asume toda la carga del control de congestión, o bien ECN marca de forma demasiado agresiva (K-min demasiado bajo) y los emisores reducen la tasa antes de que exista una congestión real. OcNOS-DC incluye valores por defecto que funcionan en la mayoría de las fabrics TH4 / TH5; para las fabrics que deban desviarse, cada parámetro está modelado en YANG y es verificable. Para dimensionar los niveles leaf-spine sobre los que se ejecutan esos valores por defecto, utilice la Herramienta de dimensionamiento de AI Fabric.

¿Ajustando DCQCN para una carga de trabajo real? Tráiganos sus trazas.

Solicite una demostración técnica →
Preguntas frecuentes

Preguntas frecuentes

¿Qué es DCQCN?
El DCQCN (Data Center Quantized Congestion Notification) es el algoritmo de control de congestión que mantiene el tráfico RoCEv2 RDMA lossless en las fabrics de AI y almacenamiento sobre Ethernet. Limita a los emisores antes de que las colas se desborden, de modo que los flujos de GPU y almacenamiento evitan las pérdidas de paquetes y los bloqueos.
¿Cómo funciona DCQCN?
DCQCN funciona en un bucle cerrado: un conmutador marca los paquetes con ECN cuando una cola supera su umbral, el receptor devuelve un Congestion Notification Packet (CNP) al emisor, y el emisor reduce su tasa de envío para recuperarla luego de forma gradual a medida que se disipa la congestión.
¿Cómo funcionan juntos DCQCN y PFC?
DCQCN es el control principal y PFC actúa como último recurso. El marcado ECN y la realimentación CNP ralentizan a los emisores de forma temprana, de modo que los flujos rara vez llegan a la pausa. PFC solo se activa si aun así se llenan los búferes, evitando las pérdidas. La optimización busca mantener la fabric bajo control ECN y fuera de una pausa PFC sostenida.
¿Cuáles son los umbrales ECN K-min y K-max en DCQCN?
K-min y K-max son los umbrales de profundidad de cola que controlan el marcado ECN. Por debajo de K-min no se marca ningún paquete; por encima de K-max se marcan todos. Entre ambos, la probabilidad de marcado aumenta hacia un máximo establecido, de modo que la señalización de congestión escala con la acumulación de la cola en lugar de activarse de forma abrupta.
¿Requiere DCQCN el uso de RoCEv2?
Sí, DCQCN está diseñado para el tráfico RDMA RoCEv2 y se apoya en puntos finales RoCEv2 que generan la retroalimentación CNP y actúan en consecuencia. Combina el ECN en la red con el control de tasa en los emisores RoCEv2, por lo que constituye la opción estándar de control de congestión para las fabrics RoCEv2.