Postgres 쿼리 계획 지연 시간 44.7% 줄인 4B 파라미터 RL 모델 공개
핵심 내용
Postgres 쿼리 계획 생성 지연 시간을 44.7% 줄이고 최대 1.81배의 가속을 달성한 4B 파라미터 RL 모델이 공개되었다.
자세히 보기
Rohan Bansal은 Postgres의 기본 쿼리 계획 생성보다 평균 44.7%의 지연 시간 감소와 기하 평균 1.81배의 속도 향상을 달성한 4B 파라미터 모델을 공개했다. 이 모델은 Leis et al. 연구에서 지적된 NP-hard 한계와 Postgres의 cardinality 추정 오류를 해결하기 위해 개발되었다.
학습 방법론
모델은 off-policy distillation과 reinforcement learning을 결합하여 훈련되었다. GPT-6 Astra의 궤적 기반 off-policy distillation을 통해 qo-agent harness 언어 습득 문제를 해결했으며, 노이즈가 많은 환경에서 RL rollout을 채점하기 위해 커스텀 GRPO 변형을 설계했다.
성능 벤치마크 결과
IMDb 기반 JOB 벤치마크(113 쿼리)를 사용하여 성능을 평가했다. RL 학습 1,200 updates 후 다음과 같은 성과를 거두었다:
- Geometric mean speedup (Sgeo): 1.41x
- Total workload speedup (Sworkload): 1.29x
- 유효 궤적: 101/113
- 3-rollout best-of-15 방식: 지수평균 1.81x 가속 달성
모델은 Frontier 모델 검증에서 GPT-6 Astra가 5 candidates 시 Sgeo 2.54x를 기록했으나, 4B 모델은 소규모 자원으로도 경쟁력 있는 성능을 입증했다.
인프라
훈련은 2x H100 노드와 데스크톱의 Postgres 컨테이너를 사용하여 분산 실행되었으며, vLLM inference와 trainer를 분리하여 운영했다. 코드는 GitHub(polyphilz/qorl)에 공개되었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.