LLM 서빙, 띄우는 것과 잘 띄우는 것 사이
·2026.08.21 10:00
핵심 내용
토스증권은 LLM 서빙 모니터링 지표 개선과 프레임워크 버그 대응을 통해 서비스 안정성을 높였다.
자세히 보기
LLM 서빙 생태계는 빠르게 변화하고 있으며, 단순히 모델을 배포하는 것보다 '잘 띄우는 것'이 중요해졌습니다. 토스증권은 MLHub 플랫폼을 구축하여 로그와 메트릭을 정규화하고, Grafana와 Kibana를 활용해 서버 모니터링을 체계화했습니다.
기존 ML 모델과 달리 LLM은 토큰을 순차적으로 생성하므로, 모니터링 지표가 초당 생성 토큰 수와 **TTFT(첫 토큰 지연 시간)**로 변경되었습니다. 이를 통해 세 가지 주요 문제를 해결했습니다.
- Prefix Cache 미활성화: 특정 모델에서 Prefix Cache Hit Rate가 0%였던 것을 발견하여 활성화한 결과, TTFT가 약 1/10로 감소했습니다.
- vLLM 버그: 리즈닝 모델에서
finish_reason이length로 종료되는 문제를 발견하고, vLLM의 버그임을 확인하여 임시 방편을 적용해 에러율을 낮췄습니다. - 처리량 최적화: KV Cache 사용량이 낮다는 점을 파악하여 동시성(Concurrency)을 20까지 늘리는 테스트를 통해, 자원 증설 없이 트래픽 처리량을 4배까지 끌어올렸습니다.
이러한 경험은 중앙화된 모니터링, 지표 관찰, 가설 검증, 그리고 빠른 롤백 시스템이 LLM 서비스 운영의 핵심임을 보여줍니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.