AWS, MLOps 분산학습 워크숍 개최…SageMaker 기반 대규모 모델 학습 및 추론 전략 공유
핵심 내용
AWS가 국내 고객사를 대상으로 MLOps와 대규모 분산학습 실무 워크숍을 열고 SageMaker 기반의 데이터 메쉬 구축 및 Trainium 활용 사례를 공유했다.
자세히 보기
AWS 코리아가 2022년 11월 8일부터 9일까지 역삼 센터필드에서 고객사 대상 MLOps 분산학습 워크숍을 진행했다. 이번 행사는 아시아 국가 중 한국에서 최초로 시도된 형태로, 현업 담당자를 위한 실습 중심의 프로그램으로 운영되었다.
MLOps 실무 적용 및 국내 사례
첫날 오전에는 Emily Webber의 기조연설과 함께 JP Morgan의 Data Mesh 구축, Fidelity의 Feature Store 활용 등 해외 선진 사례가 소개되었다. Data Mesh는 중앙집중형 Data Lake를 역할별로 분리하여 복잡도를 관리하는 새로운 패러다임으로 주목받았다. 오후 세션에서는 LG 등 국내 제조업 기업들이 SageMaker를 활용해 ETL, Model Registry, Deployment 등을 통합 관리한 사례를 발표했으며, 참가자들은 SageMaker의 다양한 기능을 직접 실습했다.
대규모 분산학습 트렌드와 기술
둘째 날에는 Text-to-Image, Text-to-Video 등 대규모 애플리케이션 등장으로 인한 분산학습의 필요성이 강조되었다. AWS는 Scaling Laws에 따라 데이터와 모델 파라미터 증가 시 성능이 향상됨을 확인했으며, 이를 위해 Trainium 칩을 활용한 Data Parallelism과 Model Parallelism 방식을 지원한다. SageMaker Ephemeral Training 클러스터와 Spot Instance를 조합하면 학습 비용을 절감할 수 있으나, 모델 크기가 커질 경우 주의가 필요하다.
추론 최적화 및 모델 모니터링
참가자들은 SageMaker Studio에서 GPT-2 모델을 학습하며 CloudWatch 연동 로그를 확인하고, 데이터 과학자의 스킬셋에 맞춘 다양한 추론 배포 방법을 체험했다. 또한 Amazon SageMaker Debugger로 학습 과정의 병목 현상을 분석하고, Data Clarify와 Model Monitor를 통해 데이터 드리프트를 감지하여 모델 성능을 유지하는 방안을 논의했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.