LLM 성능 최적화를 위한 요청 큐잉 전략
Efficient Request Queueing – Optimizing LLM Performance
·2025.04.02 22:33
핵심 내용
특정 사용자의 요청 독점을 방지하기 위해 API 서버 계층에서 페어 스케줄링을 도입하는 전략을 제안한다.
1 / 2
자세히 보기
vLLM이나 HuggingFace TGI와 같은 추론 엔진은 기본적으로 단일 큐를 사용합니다. 이로 인해 특정 '헤비 유저'가 대량의 요청을 보낼 경우 큐가 점유되어, 다른 사용자의 요청이 처리되지 못하고 차단되는 문제가 발생합니다.
이를 해결하기 위해 추론 엔진 앞단에 별도의 **API 서버(LLM-Server)**를 배치하는 구조를 제안합니다. 사용자별로 독립적인 큐를 생성하고 라운드 로빈(Round-robin) 방식으로 요청을 스케줄링하면, 추론 엔진에 요청을 전달하기 전에 공정성을 확보하는 **페어 스케줄링(Fair Scheduling)**이 가능해집니다.
더 나아가 다음과 같은 최적화 방안을 고려할 수 있습니다:
- 처리 시간 기반 우선순위: 요청의 생성 길이를 고려하여 짧은 요청을 우선 처리하는 방식
- KV-캐시 인지 라우팅(KV-cache-aware routing): 요청 간 유사성을 기반으로 배치하여 캐시 적중률을 극대화하는 방식 (예: NVIDIA Dynamo, AIBrix)
- 우선순위 큐 활용: 실시간 채팅과 같은 인터랙티브 서비스에는 높은 우선순위를, 대량의 코드 리뷰와 같은 배치 작업에는 낮은 우선순위를 부여하는 방식
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.