AI Briefing

무븐트, AWS 기반 댄스 생성 AI 인프라 구축기: GPU 추론 분리 및 서빙 최적화

·2026.09.29 14:04

핵심 내용

g7e.2xlarge 인스턴스 전환으로 생성 속도 3~5배 향상, 신규 사용자 대기 시간 57.5% 단축

1 / 6

자세히 보기

무븐트(MVNT)는 춤 생성 AI 모델을 개발하며, 범용 모델로 다루기 어려운 안무 특화 데이터를 확보하고 글로벌 사용자에게 안정적으로 서빙하기 위해 AWS 기반 인프라를 구축했습니다. 핵심은 대량의 비정형 댄스 영상을 학습 데이터로 변환하는 파이프라인과 GPU 추론을 비동기로 분리한 아키텍처입니다.

데이터 파이프라인: 비정형 영상을 학습 데이터로

무븐트는 모션 캡처(정확도)와 영상 분석(양)을 결합한 하이브리드 방식으로 데이터를 수집합니다. 원본 영상이 Amazon S3에 업로드되면 이벤트가 발생하고, Amazon SQS 큐를 통해 요청을 버퍼링합니다. GPU가 필요한 Human Mesh Recovery(HMR) 추론은 Amazon EC2 워커가 비동기로 처리하며, 실패 시 Amazon SNS와 DynamoDB를 통해 오류를 기록하고 재처리합니다. 이 과정을 통해 영상은 포즈, 모션, 메시 등 구조화된 학습 데이터셋으로 변환됩니다.

추론 서빙 아키텍처: 다중 계층 구조와 최적화

초기 단일 서버 구조의 한계를 극복하기 위해 Amazon VPC 내에서 웹, 앱, 데이터베이스 계층을 분리했습니다. 웹 계층은 CPU 기반 EC2로 요청을 수신하고, 앱 계층은 GPU 기반 EC2 Auto Scaling group으로 모델 추론을 담당합니다. 데이터 계층에는 Amazon Aurora를 사용해 읽기 트래픽을 분산하고 가용성을 높였습니다.

성능 개선 및 확장성 검증

자체 디퓨전 모델 추론을 g5에서 g7e.2xlarge GPU 인스턴스로 전환하면서 생성 속도가 크게 향상되었습니다. 20초 오디오 생성 시간이 기존 3~5분에서 약 35초로 단축되는 등 3~5배 빨라졌으며, 신규 사용자의 첫 결과물 대기 시간은 약 2분에서 51초로 57.5% 감소했습니다. 이러한 최적화 덕분에 2026년 8월 Unreal Fest Seoul에서 현장 50명과 온라인 2,000명이 동시에 접속하는 트래픽을 안정적으로 처리했으며, 한 달간 신규 가입 3배, 생성 요청 2배 증가를 뒷받침했습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.