AI Briefing

Ai2, GPU 스케줄링을 시간 예산 방식으로 전면 개편

Impactful scheduling for GPU clusters

·2026.10.10 00:20

핵심 내용

Ai2가 GPU 시간 예산 기반 스케줄러로 디버그 대기 시간을 2시간에서 30초로 단축했다.

1 / 4

자세히 보기

Ai2의 AI 인프라 팀은 GPU 수요가 용량을 2~3배 초과하는 불균형을 해결하기 위해 우선순위 기반 GPU 스케줄러를 GPU 시간 예산, 계층적 공평 배분, 시간 분할 계약 기반 시스템으로 교체했다. 이 변경은 불투명한 자원 경쟁을 투명한 행정적 예산 관리 프로세스로 전환하여 '자원 독점(squatting)'과 우선순위 인플레이션을 방지하는 것을 목표로 한다.

핵심 메커니즘

새로운 아키텍처는 GPU 소유권에서 시간 할당으로 전환하며, 프로그램, 프로젝트, 연구자 순으로 계층화된다.

  • 공평 배분 스케줄러: 슬라이딩 룩백 윈도우(기본 7일)를 사용하여 점유율을 추적한다. 할당된 점유율(예산 차감, 최소 실행 시간으로 보호)과 미할당 점유율(예산 차감 없음, 선점 가능, 유휴 주기 채우기 용도)을 구분한다.
  • 스케줄링 계약: 워크로드는 중요한 실행 중 선점을 방지하기 위해 최소 실행 시간을 선언해야 한다. 이 기간 이후에는 공평성을 위해 작업을 선점하고 재대기열에 넣을 수 있다.
  • 예산 집행: 리더십은 연구 프로젝트에 GPU 시간 예산을 설정한다. 예산을 초과하는 요청은 선점 가능하여 스케줄러 남용 비용을 높인다.

측정된 결과

7월 말부터 시작된 30일간의 테스트 롤아웃 이후, 시스템은 상당한 운영 개선을 달성했다.

  • 디버그 워크로드 지연: 디버그 워크로드의 p90 대기열 대기 시간이 2시간에서 30초로 단축되었다(시뮬레이션 예측은 6시간에서 5분).
  • 클러스터 점유율: 수요가 용량을 2~3배 초과했음에도 변경 전후 모두 **98%**의 점유율을 유지했다.
  • 예산 준수: 팀들은 할당된 GPU 시간의 **98%**를 확보했으며, 15개 팀 중 13개 팀이 95% 이상을 확보했다.
  • 온콜 업무 부담: 워크로드 자동 드레이닝 및 재시작으로 인간 개입 유지보수 요구 사항이 74% 감소했다.
  • 대기열 지연: 가장 큰 H100 클러스터의 중앙값 대기열 대기 시간이 5분에서 24초로 감소했으며, p90 대기 시간은 약 3분의 1로 줄었다.

과제 및 로드맵

전환 과정은 가파른 학습 곡선과 문화적 마찰을 초래하여 새로운 용어를 명확히 하기 위한 라이브 설명 세션이 필요했다. 인터랙티브 세션(예: 데이터 분석)의 경우, 변동적인 상태 의존성으로 인해 선점 비용이 이전 시스템의 최대 1주간의 자원 보유 능력에 비해 높다는 주요 한계가 드러났다. Ai2는 데이터 준비용 CPU 전용 클러스터에 투자하고 CPU 워크로드용 복원 가능한 세션을 개발하여 이를 해결하고 있다. 또한 팀은 최소 실행 시간 보호 장치가 동시 선점 기회를 줄여 가장 큰 워크로드의 대기 시간을 증가시킬 수 있는 용량 파편화 문제를 조사 중이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.