AI Briefing

진정한 서버리스 GPU를 구현하는 방법

·2026.05.13 09:00

Modal은 버퍼와 체크포인트 복원으로 서버리스 GPU 기동을 50초 수준으로 줄였다.

Modal은 AI 추론이 훈련보다 훨씬 변동성이 큰 만큼 서버리스에 더 잘 맞는다고 본다. 하지만 새 replica를 띄우는 데 수십 분이 걸리면 수요 변화에 맞춰 즉시 늘릴 수 없고, B200 위에서 SGLang으로 billion-parameter LLM을 올리는 일도 GPU 확보만으로 오래 지연될 수 있다.

문제의 핵심은 GPU Allocation Utilization이다. 이는 GPU-seconds running application code ÷ GPU-seconds paid for로 정의되며, 기사에 따르면 2024년 조사에서 다수 조직은 피크 시점에도 70% 미만에 머물렀고 실제 값은 10~20% 수준까지 떨어진다. 고정 할당으로는 스파이크를 버티기 어렵고, 과잉 프로비저닝은 비용만 키운다.

해결책은 네 가지다.

  • Cloud buffers: 건강한 유휴 GPU를 소량 유지해 새 replica를 즉시 얹는다.
  • Custom filesystem: 컨테이너 이미지를 content-addressed, multi-tier 캐시에서 지연 로딩해 root filesystem 구축 시간을 줄인다.
  • Checkpoint/restore: CPU 쪽 초기화를 메모리 상태 복원으로 건너뛴다.
  • CUDA checkpoint/restore: GPU 쪽 CUDA context 초기화를 직접 복원해 건너뛴다.

이 조합으로 Modal은 인퍼런스 서버 스핀업을 약 40배 단축해 약 2,000초에서 약 50초 수준으로 줄였다고 설명한다. 결과적으로 수요가 들쭉날쭉한 추론 워크로드에서도 공급을 빠르게 따라붙게 만들어, 더 가까운 의미의 진정한 서버리스 GPU를 구현한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.