서빙 공정성(Serving Fairness)
·2026.06.18 05:02
Cohere는 멀티테넌트 환경에서 특정 사용자의 트래픽 폭주가 다른 사용자에게 영향을 주지 않도록 하는 LLM 서빙 공정성 솔루션을 소개했다.
멀티테넌트 SaaS 플랫폼에서 LLM을 운영할 때, 특정 고객의 갑작스러운 트래픽 급증은 다른 고객의 지연 시간(Latency)을 증가시키는 Noisy Neighbor(이웃 소음) 문제를 야기한다. 이를 해결하기 위해 Cohere는 아키텍처 패턴과 스케줄링 알고리즘을 결합한 새로운 솔루션을 도입했다.
Cohere의 솔루션은 크게 네 가지 메커니즘이 계층적으로 작동하며, 각 단계는 다음과 같다.
- Rate Limiter: 요청이 큐에 진입하기 전, 엔드포인트별로 분당/월간 요청 수를 제한하여 시스템 과부하를 방지한다. 지연 시간 목표를 달성할 수 없는 경우 요청을 조기에 거절하여 예측 가능한 성능을 유지한다.
- Performance Tier: **SLA(Service Level Agreement)**에 따라 컴퓨팅 자원의 우선순위를 결정한다. 높은 비용을 지불하는 티어의 고객에게 더 빠른 큐 처리 권한을 부여한다.
- Deficit Round Robin (DRR): 동일 티어 내에서 자원을 공정하게 배분하는 핵심 알고리즘이다. 각 테넌트에게 **Quantum(쿼텀)**이라 불리는 작업 예산을 할당하고, 차례대로 돌아가며 작업을 처리함으로써 특정 테넌트가 GPU 자원을 독점하는 것을 방지한다.
이러한 계층적 접근 방식은 배치(Batching) 효율성을 유지하면서도, 각 테넌트가 자신의 우선순위와 마감 기한 내에서 공정한 컴퓨팅 자원을 할당받을 수 있도록 보장한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.