AI 패브릭 IP 서비스
다음 몇 섹션에서는 백엔드 GPU 패브릭에서 트래픽 혼잡 및 트래픽 부하 분산을 처리하는 데 사용할 수 있는 다양한 전략에 대해 설명합니다.
혼잡 관리
AI 클러스터는 고밀도 및 저엔트로피 트래픽 패턴으로 인해 네트워크 인프라에 고유한 요구 사항을 제기하며, 이는 최소한의 흐름 변동과 빈번한 엘리펀트 플로우를 특징으로 합니다. 또한 대부분의 AI 모드에서는 훈련 작업을 완료하기 위해 패킷 손실 없이 중단 없는 패킷 플로우이 필요합니다.
이러한 이유로 AI 트래픽 플로우를 위한 네트워크 인프라를 설계할 때 주요 목표에는 무손실 패브릭에 대한 최대 처리량, 최소 지연 시간 및 최소 네트워크 간섭이 포함되므로 효과적인 혼잡 제어 방법을 구성할 필요가 있습니다.
DCQCN(Data Center Quantized Congestion Notification)은 RoCEv2(RDMA over Converged Ethernet) 트래픽에 대한 엔드 투 엔드 혼잡 제어를 위한 업계 표준이 되었습니다. DCQCN 혼잡 제어 방법은 패킷 드롭에 의존하지 않고 트래픽 속도 감소와 트래픽 중지 사이의 균형을 유지하여 혼잡을 완화하는 기술을 제공합니다.
DCQCN은 주로 AI 워크로드 트래픽의 대부분이 상주하는 GPU 백엔드 패브릭에 필요한 반면, 일반적으로 프론트엔드나 스토리지 백엔드에서는 필요하지 않다는 점에 유의하는 것이 중요합니다."
DCQCN은 흐름 및 혼잡 제어를 위해 두 가지 메커니즘을 결합합니다.
- 우선순위 기반 플로우 제어(PFC) 및
- 명시적 혼잡 알림(ECN).
우선순위 기반 플로우 제어(PFC)
우선순위 기반 플로우 제어(PFC) 는 이더넷 네트워크 디바이스용 표준(IEEE 802.1Qbb) 배압 메커니즘으로, 혼잡을 신호로 보내고 특정 우선순위의 트래픽이 패킷 드롭을 일시적으로 중지하게 합니다. PFC는 특정 대기열 또는 포트에 매핑된 개별 트래픽 우선순위(IEEE 802.1p 또는 DSCP 표시)에 대한 트래픽 플로우를 중지하여 혼잡을 완화하는 데 도움이 됩니다.
PFC의 목표는 정의된 시간(PAUSE 시간) 동안 또는 혼잡이 해소될 때까지 이웃이 트래픽을 전송하지 못하도록 막는 것입니다. 이 프로세스는 PAUSE 제어 프레임을 업스트림으로 전송하여 혼잡이 진행되는 동안 특정 클래스 또는 우선순위에 대한 모든 트래픽의 전송을 중단하도록 발신자에게 요청하는 것으로 구성됩니다. 발신자는 지정된 우선순위에 대해 수신 디바이스로의 트래픽 전송을 완전히 중단합니다.
RoCE 트래픽의 경우, PFC는 혼잡을 감지하고 PFC 프레임 업스트림을 생성하는 패브릭 스위치와 PFC 일시 중지 프레임을 수신하고 그에 따라 반응하는 전송 NIC를 포함하여 이러한 프레임에 응답할 수 있는 디바이스에 의존합니다.
PFC는 데이터 손실을 완화하고 수신자가 대기열에 이미 있는 처리 패킷을 따라잡을 수 있게 해주지만, 혼잡 기간 동안 영향을 받는 대기열을 사용하는 애플리케이션의 성능에 영향을 미칩니다. 또한 혼잡 이후의 트래픽 전송을 재개하면 종종 급증이 발생하여 잠재적으로 혼잡 시나리오가 악화되거나 복원될 수 있습니다.
리프 노드 역할을 하는 QFX 디바이스에서만 PFC를 구성하는 것이 좋습니다.
그림 20: DCQCN – PFC 작동

명시적 혼잡 알림(ECN)
ECN(Explicit Congestion Notification) 은 이더넷 네트워크 디바이스에 대한 표준(RFC 3168) 배압 메커니즘으로, 혼잡을 신호로 보내고 패킷 드롭을 방지하기 위해 트래픽을 일시적으로 느리게 합니다. ECN은 혼잡 중에 전송 속도를 줄이는 동시에 혼잡이 가라앉을 때까지 속도가 감소하더라도 트래픽이 지속되도록 합니다. ECN의 목표는 혼잡이 해소될 때까지 트래픽 소스가 전송 속도를 낮추도록 하여 패킷 손실과 지연을 줄이는 것입니다.
이 프로세스에는 IP 헤더에서 ECN 비트를 11로 설정하여 혼잡 지점에서 ECN 비트로 패킷을 표시하는 작업이 수반됩니다. 이 ECN 표시가 있으면 수신자가 소스로 다시 전송되는 혼잡 알림 패킷(CNP)을 생성하도록 유도하며, 이는 소스에 트래픽 속도를 제한하도록 신호를 보냅니다.
그림 21과 같이 RoCE 트래픽용 ECN은 혼잡을 감지하고 다운스트림 트래픽에 대한 ECN 마킹을 구현할 수 있는 패브릭 스위치와 이러한 마킹에 응답할 수 있는 디바이스에 의존합니다.
그림 21: DCQCN – ECN 작업

- 수신 NIC 또는 알림 포인트(NP)는 ECN 표시된 패킷을 수신할 때 CNP를 전송합니다
- CNP 패킷을 수신하고 그에 따라 반응하는 전송 NIC 또는 RP(Reaction Point)
PFC와 ECN을 결합하면 RoCEv2를 지원하는 무손실 IP 패브릭에서 가장 효과적으로 혼잡을 완화하는 동시에 패킷 손실을 방지할 수 있습니다. 이를 달성하려면 PFC와 ECN을 함께 구현할 때 ECN이 PFC 전에 트리거되도록 해당 매개변수를 신중하게 선택해야 합니다.
RDMA 트래픽에 대한 TOS/DSCP
스위치가 RDMA 트래픽을 올바르게 분류하고 적절한 처리를 위해 무손실 대기열에 배치할 수 있도록 적절하게 표시해야 합니다. 마킹은 IP 헤더 내의 DSCP 또는 이더넷 프레임 vlan-tag 필드의 PCP일 수 있습니다. DSCP 또는 PCP의 사용 여부는 GPU 서버와 스위치 간의 인터페이스가 VLAN 태깅(802.1q)을 수행하는지 여부에 따라 달라집니다. 그림 64는 RDMA와 CNP가 어떻게 다르게 표시되는지 보여주며, 그 결과 패브릭 스위치가 두 가지 유형의 패킷을 다르게 분류하고 스케줄링합니다.
그림 22: TOS/DSCP 작동

자세한 내용은 DCQCN(ECN 및 PFC) 혼잡 제어 방법 및 DLB를 사용하여 AI 워크로드를 위한 무손실 패브릭을 구축하는 방법을 탐구하는 주니퍼 AI 네트워크의 혼잡 제어 소개 를 참조하세요. 이 문서는 DLRM 학습 모델을 참조로 사용하며 ECN 및 PFC 카운터, 입력 드롭 및 테일 드롭과 같은 다양한 혼잡 매개 변수를 모니터링하여 구성을 조정하고 RoCEv2 트래픽을 위한 무손실 패브릭 인프라를 구축하는 방법을 보여줍니다.
알림: 일반적인 권장 사항을 제공하고 랩에서 검증된 파라미터에 대해 설명합니다. 그러나 각 언어 모델에는 고유한 트래픽 프로필과 특성이 있습니다. 서비스 등급 및 로드 밸런싱 속성은 특정 모델 요구 사항을 충족하도록 조정해야 합니다.
로드 밸런싱
모든 패브릭의 이 JVD에 사용되는 패브릭 아키텍처는 모든 리프 노드가 여러 인터페이스를 통해 사용 가능한 모든 스파인 노드에 연결된 2단계 Clos 설계를 따릅니다. 그 결과, 리프와 스파스파인 노드 간에 여러 경로를 사용하여 다른 디바이스에 도달할 수 있습니다.
ECMP(Equal Cost Multiple Path)는 AI 트래픽을 분산할 때 최적이 아닌 링크 활용도로 이어질 수 있습니다. ECMP는 선택한 패킷 헤더 필드를 해싱하여 사용 가능한 경로로 흐름을 분산시킵니다. 그러나 AI 워크로드는 일반적으로 매우 유사한 헤더 특성(예: 동일한 소스 및 대상 주소, 포트, 프로토콜)을 가진 대규모의 수명이 긴 플로우를 생성합니다. 이러한 제한된 플로우 다양성은 해싱 엔트로피를 크게 줄여 여러 플로우가 동일한 링크에 매핑되도록 합니다. 그 결과, 특정 링크는 과도하게 활용되고 다른 링크는 충분히 활용되지 않아 혼잡 및 패킷 손실의 위험이 증가합니다. 이는 GPU 간 통신이 발생하는 GPU 백엔드 패브릭에서 특히 중요합니다.
사용 가능한 모든 경로에서 트래픽 분산을 개선하기 위해 ECMP 대신 동적 로드 밸런싱(DLB), ECMP용 적응형 로드 로드 밸런싱(ALB) 또는 글로벌 로드 밸런싱(GLB)을 구현할 수 있습니다.
이를 위해 모든 QFX 리프 노드와 스파인 노드에서 JVD 동적 로드 밸런싱 flowlet-mode 를 검증하고 PTX 스파인 노드에서 적응형 로드 밸런싱(ALB)을 검증했습니다. 글로벌 로드 밸런싱 도 대체 솔루션으로 포함되어 있습니다.
선택적 동적 로드 밸런싱 및 반응형 경로 재조정을 평가하기 위해 QFX5240-64OD/QFX5241-64OD에 대한 추가 테스트가 수행되었습니다. 이러한 로드 밸런싱 메커니즘은 QFX 디바이스에서만 사용할 수 있습니다.
동적 로드 밸런싱(DLB)
DLB는 패킷 헤더뿐만 아니라 경로 선택 시 포트 로드(링크 사용률) 및 포트 대기열 깊이를 기반으로 실시간 링크 품질을 고려하여 모든 경로가 보다 공정하게 활용되도록 보장합니다. 이 방법은 많은 양의 데이터를 이동하는 여러 개의 수명이 긴 흐름을 로드 밸런싱해야 할 때 더 나은 결과를 제공합니다.
DLB는 두 가지 모드로 구성할 수 있습니다.
- 패킷당 모드: 동일한 플로우의 패킷이 IP ECMP 그룹의 링크 멤버에 분사되며, 이로 인해 패킷이 순서대로 도착하지 않을 수 있습니다.
- 플로우렛 모드: 동일한 플로우의 패킷이 IP ECMP 그룹의 링크 멤버를 통해 전송됩니다. 플로우렛은 비활성 기간으로 구분된 동일한 플로우의 버스트로 정의됩니다. 플로우가 구성된 비활성 타이머보다 더 오래 일시 중지되면 링크 멤버의 품질을 재평가하고 플로우를 다른 타이머에 재할당할 수 있습니다.
적응형 로드 밸런싱(ALB):
적응형 로드 밸런싱(ALB)은 동일한 비용 경로에서 트래픽 불균형을 감지하고 수정하여 정적 해시 기반 포워딩으로 달성할 수 있는 수준 이상으로 링크 활용도를 개선하도록 설계된 피드백 기반 메커니즘입니다. ALB는 고정된 ECMP 해싱에만 의존하는 대신 트래픽 분포를 지속적으로 평가하고 포워딩 동작을 동적으로 조정하여 과부하 조건을 완화하고 사용 가능한 링크의 공정한 사용을 촉진합니다.
ALB는 해시 버킷과 관련된 패킷 및 바이트 속도와 해당 다음 홉 매핑을 모니터링하여 작동합니다. ukernel에서 실행되는 적응형 모니터링 프로세스는 ALB가 활성화된 모든 다음 홉을 주기적으로 스캔합니다. 모니터링 간격은 사용자가 구성할 수 있으며 몇 초 정도로 짧을 수 있습니다.
각 스캔 주기 동안 ALB는 해당 다음 홉에 매핑된 모든 해시 버킷이 전달하는 트래픽을 합산하여 다음 홉당 총 트래픽 속도를 계산합니다. 이 관측 속도를 이상적인 균형 속도와 비교합니다. 편차가 사용자가 구성할 수 있는 허용 오차 임계값을 초과하면 불균형 보상 알고리즘이 트리거됩니다.
불균형이 감지되면 ALB는 선택기를 다시 프로그래밍(해시 버킷에서 다음 홉으로의 매핑)하여 트래픽을 많이 사용되는 다음 홉에서 덜 활용되는 다음 홉으로 이동시켜 시정 조치를 취합니다. 이 재분배 프로세스는 링크 간 로드 차이를 최소화하는 방식으로 해시 버킷을 재할당하기 때문에 빈 패킹 문제를 효과적으로 해결합니다. 관련된 계산 복잡성으로 인해 ALB는 각 모니터링 간격에서 이러한 조정을 점진적으로 수행합니다.
기본적으로 모니터링 간격은 30초이며 1초에서 5개의 30초 간격으로 구성할 수 있습니다. 각 간격 동안 제어 소프트웨어는 최근 2초 동안 수집된 패킷 및 바이트 카운터를 읽고 현재 트래픽 속도를 계산하고 재조정 결정을 알려줍니다.
불균형을 감지하는 데 사용되는 허용 오차 임계값은 다음과 같이 정의됩니다.
ALB는 PTX10001-36MR, PTX10002-36QDD, PTX10003, PTX10004, PTX10008, PTX10016 플랫폼에서 지원되며, Junos OS Evolved 릴리스 24.4R1부터 지원됩니다.
글로벌 로드 밸런싱(GLB):
GLB는 로컬 링크 대역폭 사용률만 고려하는 DLB의 개선 사항입니다. 반면 GLB는 NNH(Next-to-Next-Hop) 수준에서 링크의 대역폭 사용률에 대한 가시성을 제공합니다. 따라서 GLB는 트래픽 흐름을 재라우팅하여 DLB가 감지할 수 있는 것보다 네트워크에서 더 멀리 떨어진 트래픽 혼잡을 피할 수 있습니다.
AI-ML 데이터센터는 다른 네트워크보다 엔트로피가 적고 데이터 플로우가 큽니다. 해시 기반 로드 밸런싱이 엔트로피가 적은 트래픽의 대용량 데이터 흐름을 항상 효과적으로 로드 밸런싱하는 것은 아니기 때문에 동적 로드 밸런싱(DLB)이 대신 사용됩니다. 그러나 DLB는 로컬 링크 대역폭 사용률만 고려합니다. 이러한 이유로 DLB는 바로 다음 홉에서만 트래픽 혼잡을 효과적으로 완화할 수 있습니다. GLB는 원격 링크의 트래픽 혼잡을 고려하여 대규모 데이터 흐름을 보다 효과적으로 로드 밸런싱합니다.
GLB는 23.4R2 및 24.4R1부터 시작하는 QFX-5240(TH5)에서만 지원되며, 완전한 3계층 CLOS 아키텍처가 필요하며, 각 스파인과 리프 사이에는 단 하나의 링크로 제한됩니다. 한 쌍의 리프와 스파인 사이에 둘 이상의 인터페이스 또는 번들이 있는 경우, GLB는 작동하지 않습니다. 또한 GLB는 테이블에서 64개의 프로필을 지원합니다. 즉, GLB가 실행되는 3단계 Clos 토폴로지에는 64개의 리프가 있을 수 있습니다.
GLB의 운영 및 구성에 대한 자세한 내용은 글로벌 로드 밸런싱으로 AI/ML 트래픽 혼잡 방지 | HPE 주니퍼 네트워킹 블로그
주니퍼 AI 네트워크의 혼잡 제어 소개 에서는 DCQCN(ECN 및 PFC) 혼잡 제어 방법과 DLB를 사용하여 AI 워크로드를 위한 무손실 패브릭을 구축하는 방법을 살펴봅니다. 이 문서는 DLRM 학습 모델을 참조로 사용하며 ECN 및 PFC 카운터, 입력 드롭 및 테일 드롭과 같은 다양한 혼잡 매개 변수를 모니터링하여 구성을 조정하고 RoCEv2 트래픽을 위한 무손실 패브릭 인프라를 구축하는 방법을 보여줍니다.
데이터센터의 로드 밸런싱은 다양한 로드 밸런싱 메커니즘과 데이터센터의 요구 사항에 맞게 진화하는 방법에 대한 포괄적인 심층 분석을 제공합니다.