Help us improve your experience.

Let us know what you think.

Do you have time for a two-minute survey?

 
 

AI 사용 사례 및 레퍼런스 설계

AI JVD 레퍼런스 설계는 프론트엔드 패브릭, GPU 백엔드 패브릭 및 스토리지 백엔드 패브릭을 포함하는 완전한 엔드투엔드 이더넷 기반 AI 인프라를 포괄합니다. 이 세 가지 패브릭은 공생 관계를 맺고 있으며, 각각 AI 학습 및 추론 작업을 지원하는 고유한 기능을 제공합니다. 고객은 AI 패브릭에서 이더넷 네트워킹을 사용함으로써 가장 빠른 작업 완료 시간을 제공하고, GPU 활용을 극대화하며, 한정된 IT 리소스를 사용하는 운영하기 쉬운 대용량 네트워크 패브릭을 구축할 수 있습니다.

그림 1에 표시된 AI JVD 레 퍼런스 설계: AI JVD 레퍼런스 에는 다음이 포함됩니다.

  • 프론트엔드 패브릭: 이 패브릭은 헤드엔드 서버에 상주하는 AI 도구의 GPU 노드 및 스토리지 노드에 대한 게이트웨이 네트워크입니다. 프론트엔드 GPU 패브릭을 통해 사용자는 GPU 및 스토리지 노드와 상호 작용하여 훈련 또는 추론 워크로드를 시작하고 진행 상황과 결과를 시각화할 수 있습니다. 또한 NCCL(NVIDIA Collective Communications Library) 집단 통신을 위한 대역 외 경로를 제공합니다.
  • GPU 백엔드 패브릭: 이 패브릭은 GPU 노드(AI 워크플로에 대한 계산 작업 수행)를 연결합니다. GPU 백엔드 패브릭은 학습 작업 중에 GPU 간에 무손실 방식으로 고속 정보를 전송합니다. GPU에서 생성된 트래픽은 RoCEv2(RDMA over Ethernet v2)를 사용하여 전송됩니다.
  • 스토리지 백엔드 패브릭: 이 패브릭은 고가용성 스토리지 시스템(대규모 모델 학습 데이터 보관)과 GPU(학습 또는 추론 작업 중에 이 데이터 사용)를 연결합니다. 스토리지 백엔드 패브릭은 원활하고 안정적인 방식으로 대량의 데이터를 전송합니다.

그림 1: AI JVD 레퍼런스 설계