Amazon SageMaker HyperPod로 슈퍼브에이아이의 비전 파운데이션 모델 ‘ZERO’를 효율적으로 대규모 분산 학습하기
핵심 내용
SageMaker HyperPod로 저렴한 리허설과 Training Plan을 분리해 ZERO 학습 효율을 높였다.
자세히 보기
슈퍼브에이아이는 약 10억 장의 원시 데이터 중 실제 산업 현장에 의미 있는 400만 장을 선별해 비전 파운데이션 모델 **ZERO(Zero-shot Object Detector)**를 학습했다. ZERO는 텍스트 프롬프트나 이미지 기반 비주얼 프롬프트를 받아 객체 위치를 정밀하게 탐지하는 멀티모달 그라운딩을 핵심 기능으로 삼아, 추가 Fine-tuning 없이도 오픈 월드 환경에서 다양한 결함과 객체를 제로샷으로 검출한다.
대규모 학습 인프라로는 Amazon SageMaker HyperPod를 선택했다. 기존 클라우드가 단일 노드 위주이거나 연 단위 플랜에 묶이는 한계를 보이는 반면, HyperPod는 인스턴스 크기를 유연하게 바꿀 수 있고 EFA(Elastic Fabric Adapter) 같은 고성능 네트워크가 기본 제공돼 분산 학습과 비용 효율성 모두에 유리했다. 특히 GPU를 상시 쓰지 않는 개발 사이클에서는 리소스를 필요할 때만 크게 쓰는 방식이 적합했다.
학습 워크플로우는 다음 순서로 정리됐다.
- Training Plan 예약으로 대규모 학습 기간을 먼저 확보
- 데이터 준비와 하이퍼파라미터 튜닝 타임라인 설정
- 저렴한 GPU로 리허설을 진행해 데이터 무결성과 스크립트 버그 확인
- 준비가 끝나면 리허설 인스턴스를 해제하고 고성능 GPU 클러스터로 본 학습 실행
데이터 준비도 중요한 최적화 포인트였다. 원본 데이터를 개별 파일 상태로 Hugging Face Datasets에 열면 Arrow file 변환에 약 30시간이 걸리지만, 슈퍼브에이아이는 Arrow 기반 데이터셋 포맷으로 1G 단위 샤드 약 1200개로 미리 쪼개 Amazon S3에 업로드해 두었다. 이 과정은 몇 분 만에 읽기 준비가 끝나고, 데이터 로드 병목을 크게 줄였다.
클러스터 구성과 FSx 연동은 리허설 단계에서 미리 검증했다. g6e.8xlarge 2대를 컴퓨트 노드로 두고 멀티 노드 트레이닝이 정상 작동하는지 확인했으며, FSx for Lustre의 data repository path와 file system path 매핑도 신중하게 설정했다. 데이터가 많을수록 FSx의 메타데이터 처리와 초기 로딩이 길어질 수 있어, 사전 설계가 중요했다.
리허설은 단순 테스트가 아니라 본 학습의 실패 비용을 줄이는 단계였다. wandb login 오류, 체크포인트 디렉토리 소유권 문제 같은 사소하지만 치명적인 장애를 미리 잡았고, Trainig Plan 시작 전까지 S3의 데이터를 FSx로 미리 로드해 수 시간을 절약했다.
본 학습 전환 시에는 리허설 인스턴스를 제거하고 provisioning_parameters.json을 수정한 뒤, 새로 예약한 인스턴스 그룹과 Target Instance Count를 맞춰 클러스터를 재구성했다. 새 인스턴스가 뜬 뒤에는 scontrol reconfigure로 Slurm과 Pyxis 플러그인 상태를 정리했고, 이후 고성능 인스턴스에서 실제 학습을 진행했다. Training Plan 시작 후 약 30분 안에 트레이닝을 시작할 수 있었으며, 리허설 덕분에 예약 기간을 거의 온전히 학습에 쓸 수 있었다.
결과적으로 HyperPod는 개발 생산성, 비용 효율성, 학습 시간 단축, 안정성 확보를 동시에 제공했다. 슈퍼브에이아이는 인프라 운영 부담을 줄이고 모델 성능 고도화에 집중할 수 있었고, ZERO는 AWS Marketplace에서 바로 구독·배포할 수 있는 형태로도 제공된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.