LLM 비용 64% 절감 및 캐시 히트율 98% 달성기
·2026.07.07 14:03
무신사가 Prompt Caching을 도입하여 LLM API 비용을 64% 절감하고 캐시 히트율 98%를 달성했다.
무신사는 LLM 도입 후 급증하는 API 비용의 원인을 파악하기 위해 토큰 메트릭 대시보드를 구축했다. 분석 결과, 특정 API가 매번 약 15K 토큰에 달하는 거대한 시스템 프롬프트를 반복해서 전송하며 비용을 과다하게 발생시키고 있음을 발견했다.
이를 해결하기 위해 Prompt Caching 기술을 적용했다. 구체적으로는 다음과 같은 단계를 거쳤다.
- 프롬프트 구조 분리: 변하지 않는 시스템 프롬프트와 매번 변하는 메시지 프롬프트를 분리함
- 캐시 포인트 설정: AWS Bedrock Converse API에 캐시 포인트를 추가하여 중복되는 컨텍스트를 재사용함
그 결과, **캐시 히트율 98%**라는 높은 효율을 기록하며 전체 LLM 비용을 64% 절감하는 성과를 거두었다. 무신사는 이를 통해 대규모 컨텍스트를 사용하는 LLM 서비스의 운영 효율성을 극대화했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.
