Quail, 단일 H100 GPU로 분당 10억 토큰 처리… vLLM 대비 10배 속도 향상
핵심 내용
Quail이 단일 H100 GPU에서 분당 10억 토큰을 처리하며 vLLM 대비 10배 이상의 속도를 달성했다.
자세히 보기
Charles Frye(Modal)와 Shreya Shankar(CMU FSD Lab)가 SQL 쿼리 플래너와 추론 엔진을 통합한 시스템 Quail(QUery-Aware Inference Layer)을 공개했다. 기존 에이전트형 추론 엔진과 달리 Quail은 Snowflake Cortex AI-SQL, Databricks AI Functions, BigQuery AI functions 등 데이터베이스 내 대규모 시퀀스 처리에 특화됐다.
성능 및 아키텍처
Quail은 단일 H100 GPU에서 분당 10억 개 이상의 토큰을 처리하며 vLLM 대비 10배 이상의 속도 향상을 달성했다. Modal 기준 비용은 10억 토큰당 6센트 미만으로 떨어졌다. 새로 공개된 AI-SQL 벤치마크에서 Quail은 vLLM 대비 기하 평균 1.84배의 속도 향상을 기록했다.
LLM 기반 필터와 조인은 GPU Tensor Cores의 혜택을 받는 대규모 행렬 곱셈을 필요로 한다. 주요 아키텍처 구성 요소는 다음과 같다:
- SQL Parser:
sqlglot라이브러리를 사용해 Snowflake 및 BigQuery 방언을 지원한다. - Query Planner: Substrait를 통해 계획을 직렬화하고 최적화를 위한 커스텀 로직을 적용한다.
- Execution Engine: 커널 융합을 위해 Triton으로 수정된 vLLM 포크다.
- Storage Engine: 한 번 쓰기/여러 번 읽기 가정을 기반으로
pyarrow를 활용한다.
주요 기술 혁신
Quail의 성능은 쿼리 플래너와 실행 엔진의 두 가지 최적화에서 비롯된다:
- KV-Aware Join Ordering: 플래너는 이전 계획의 Key-Value(KV) 캐시 상태를 추적한다. 토큰 수, 어텐션 쌍, 캐시된 토큰 측면에서 우세하지 않은 후보 계획을 유지하며 Speed-of-Light(SoL) 비용 모델에 따라 최종 계획을 선택한다. 이 모델은 하드웨어 피크 속도를 사용해 최소 지연 시간을 추정한다.
- Decode Phase Elimination:
AI.IF같은 불리언 분류 작업의 경우 Quail은 프리필 단계에서 단일 토큰을 예측하여 디코드 단계, 샘플링, 추측 디코딩을 생략한다. 이를 통해add-RMSNorm과fp8양자화 결합 등 특수한 커널 융합이 가능해진다.
향후 방향
저자들은 지연 시간에 민감하지 않은 워크로드를 위해 테이프 같은 느린 스토리지를 활용하는 KV Cache Tiering, 요청 간 KV 캐시를 보존하는 Cross-Query Optimization, Larger-than-Memory Datasets 처리 등을 향후 개선 과제로 제시했다. 또한 더 나은 접두어 공유를 위한 Radix Index 구조와 실행 중 모델 최적화를 위한 On-the-fly Fine-tuning 탐구도 계획하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.