AI Briefing

LLM 비용 64% 절감 및 캐시 히트율 98% 달성기

·2026.07.07 14:03

29CM가 메트릭 가시성 확보와 Prompt Caching 도입을 통해 LLM 운영 비용을 64% 절감했다.

29CM Pricing 팀은 AWS Bedrock 기반 LLM 사용량이 증가함에 따라 비용 구조 분석을 시작했다. 초기에는 AWS 콘솔에서 API별 토큰 사용량을 확인할 수 없어 비용 발생 원인을 파악하는 데 어려움을 겪었다.

이를 해결하기 위해 메트릭 가시성 확보를 최우선 과제로 삼았다. LangChain4jChatModelListener를 활용하여 API별 input/output 토큰 사용량, 요청 수, 응답 시간, 에러 등을 추적하는 파이프라인을 구축했다.

구체적인 구현 방식은 다음과 같다:

  • 요청 경로 태깅: 서블릿 필터를 통해 요청 경로를 ThreadLocal에 담아 LLM 호출 위치를 추적하며, Prometheus 카디널리티 폭발을 방지하기 위해 특정 경로만 태그로 남긴다.
  • 메트릭 기록: 호출 종료 시점에 토큰 타입(input, output, cache_read, cache_write)을 포함한 메트릭을 Prometheus로 전송한다.
  • 대시보드 구축: 비용 계산 로직을 코드에서 분리하여 Grafana 변수로 관리함으로써 유연성을 높였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.