백엔드 GPU 레일 최적화 스트라이프 아키텍처
앞서 설명했듯이 레일 최적화 스트라이프 아키텍처 는 GPU 간의 효율적인 데이터 전송을 제공하며, 특히 합리적인 시간 내에 작업을 완료하기 위해 원활한 데이터 전송이 필요한 AI 대규모 언어 모델(LLM) 학습 워크로드와 같이 계산 집약적인 작업 중에 더욱 그렇습니다. 레일 최적화 토폴로지는 대역폭 경합, 지연 시간, 네트워크 간섭을 최소화하여 성능을 극대화하고 데이터가 네트워크 전반에 효율적이고 안정적으로 전송될 수 있도록 보장하는 것을 목표로 합니다.
레일 최적화 스트라이프 아키텍처에는 레일 과 스트라이프라는 두 가지 중요한 개념이 있습니다.
서버의 GPU는 1-8로 번호가 매겨지며, 숫자는 그림 6과 같이 서버에서 GPU의 위치를 나타냅니다. 이 숫자는 GPU가 위치하는 서버의 GPU와 관련하여 순위 또는 더 구체적으로 "로컬 순위"라고 하거나 단일 작업에 할당된 모든 GPU(여러 서버에서)와 관련하여 "글로벌 순위"라고 합니다.
레일은 패브릭의 리프 노드 중 하나에서 동일한 순서의 GPU를 연결합니다. 즉, 그림 9와 같이 레일 Nth는 모든 서버의 N번째 위치에 있는 모든 GPU를 리프 노드 Nth에 연결합니다.
그림 9: 레일 최적화 아키텍처의 레일
스트라이프는 여러 레일로 구성되며 여러 리프 노드와 GPU 서버를 포함하는 설계 모듈 또는 빌딩 블록을 나타냅니다.
그림 10: 레일 최적화 아키텍처의 스트라이프
그림 11과 같이 동일한 순위의 GPU 간의 모든 트래픽(레일 내부 트래픽)은 리프 노드 수준에서 전달됩니다.
그림 11: 레일 내 GPU 투 GPU 트래픽 예.
스트라이프를 복제하여 AI 클러스터의 서버(N1) 및 GPU(N2) 수를 확장할 수 있습니다. 그런 다음 그림 12와 같이 스파인 스위치 전반에 여러 스트라이프(N3)가 연결됩니다.
그림 12: 스파인 노드를 통해 연결된 여러 스트라이프
레일 간 트래픽과 스트라이프 간 트래픽은 모두 그림 13과 같이 스파인 노드를 통해 전달됩니다.
그림 13. 레일 간 및 스트라이프 간 GPU 투 GPU 트래픽 예시입니다.