분산 학습을 위한 AWS 컴퓨트 선택 가이드 (2편: 초대규모 스케일링과 인스턴스 확보)
AWS가 수천 개 GPU를 묶는 UltraCluster와 용량 확보 전략을 설명했다.
Amazon EC2 UltraClusters는 수천~수만 개의 GPU 인스턴스를 페타비트급 논블로킹 EFA 네트워크 패브릭에 배치해 대규모 분산 학습을 지원한다. 일반적인 Placement Group보다 큰 규모에서 노드 간 대역폭을 균일하게 유지해, 특정 통신 경로의 병목과 GPU 유휴를 줄이는 구조다.
UltraCluster는 단일 스위치가 아니라 여러 스위치를 계층적으로 연결한 folded Clos 네트워크로 구성된다. UltraCluster 2.0에서는 호스트 간 최대 경로를 3-tier Clos의 7홉에서 2-tier Clos의 5홉으로 줄였으며, 지연 차이보다 중요한 full bisection 대역폭을 보장하는 데 초점을 둔다.
노드 간 통신은 EFA의 SRD 프로토콜과 GPUDirect RDMA를 통해 CPU를 거치지 않고 GPU 메모리 사이에서 직접 처리할 수 있다. NCCL이 aws-ofi-nccl을 통해 EFA를 사용하도록 설정되지 않으면 TCP로 조용히 폴백해 오류 없이 성능이 급락할 수 있으므로, EFA와 NCCL 설정 점검이 핵심이다.
고성능 인스턴스 확보에는 **ODCR(On-Demand Capacity Reservation)**와 Capacity Block을 활용한다. 데이터는 S3에 보관하고 FSx for Lustre로 병렬 제공하며, 수천 노드가 동시에 읽으려면 파일시스템 처리량을 충분히 프로비저닝하고 데이터 샤딩과 preload를 미리 완료해야 한다.
작업 스케줄링은 SageMaker HyperPod, AWS PCS, Amazon EKS 등이 담당하고, 체크포인트는 FSx와 S3에 저장해 노드 장애나 스팟 회수에 대비한다. UltraCluster만으로 완성되는 것이 아니라 데이터 파이프라인, 오케스트레이션, 장애 복구 체계가 함께 갖춰져야 한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.