유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링
·2026.07.16 09:00
LLM 서비스의 트래픽 변동으로 발생하는 유휴 GPU 자원을 연구 및 학습용으로 재할당하는 효율적인 스케줄링 파이프라인을 구축했다.
LLM 서비스는 트래픽 피크 타임에 맞춰 자원을 확보하기 때문에, 트래픽이 적은 시간대에는 막대한 양의 GPU 자원이 메모리만 점유한 채 유휴 상태로 머무는 문제가 발생한다.
이를 해결하기 위해 vLLM의 실시간 처리량 및 큐(Queue) 상태 메트릭을 활용한 정교한 Auto-scaling을 구현했다. 이를 통해 서비스 안정성을 유지하면서도 야간 시간대의 유휴 자원을 식별할 수 있다.
식별된 유휴 자원은 Best-effort 방식으로 연구 및 실험 작업에 할당된다. 서비스 트래픽이 급증하여 GPU 회수가 필요할 경우, 실행 중인 작업을 즉시 중단할 수 있도록 설계하여 서비스 가용성을 최우선으로 보장한다.
GPU 작업 파이프라인은 다음과 같은 특징을 갖춘다:
- 범용성: 모든 작업을 Docker 이미지 단위로 정의하여 다양한 프레임워크와 환경을 지원한다.
- 확장성 및 유연성: 새로운 작업 유형 추가 시 별도 개발 없이 실행 가능한 구조를 갖췄다.
- 재현성: 실행 설정을 코드가 아닌 파라미터로 분리하여 동일한 환경에서 실험 결과의 재현성을 보장한다.
모든 작업은 Argo Workflows 기반의 스텝 단위로 구성되며, 데이터 전처리부터 학습, 평가까지의 과정을 독립적인 스텝으로 조합하여 관리할 수 있다. 모든 결과물은 Cloud storage를 통해 관리되어 실험의 추적 가능성을 확보한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.