사내 LLM 요청을 한곳으로 모은 AI Gateway 구축기
핵심 내용
인프랩이 Envoy AI Gateway를 도입해 모델 추상화와 등급제 라우팅으로 LLM 비용을 78% 절감했다.
자세히 보기
인프랩은 30개 이상 서비스에서 발생하는 LLM API 호출을 통합 관리하기 위해 사내 AI Gateway를 구축했다. 기존 방식은 모델 수명 단축, 검증 부담, 비용 증가, 키 관리 분산 등 유지보수 문제를 야기했으며, 특히 2026년 6월 기준 LLM 비용이 AWS 비용의 23%를 차지할 정도로 비중이 컸다.
Envoy AI Gateway 선택 및 아키텍처
인프랩은 Envoy AI Gateway를 최종 도입했다. LiteLLM Proxy나 Portkey AI Gateway와 달리 CNCF 관리 프로젝트로서 핵심 기능(예산, rate limit, 인증 등)이 상용 플랜에 잠기지 않아 통제 장치를 자유롭게 구성할 수 있다는 점이 결정적이었다. Envoy Gateway와 함께 배포되며, Kubernetes Custom Resource로 라우팅 및 인증 정책을 선언해 GitOps 기반 인프라 관리를 가능하게 한다.
모델 추상화와 등급제 라우팅
서비스 코드에 특정 모델 이름을 하드코딩하지 않고 low, medium, high 3개 등급만 노출하는 추상화 계층을 적용했다. 각 등급은 최대 비용 상한($0.3, $1, $2)과 용도가 고정되어 있어, 실제 연결 모델은 게이트웨이 설정에서 변경해도 서비스 코드는 수정하지 않는다. 동일 모델의 다중 제공 업체 경로에 우선순위를 부여해 fallback을 구현하며, 할인 경로가 rate limit에 걸리면 정가 경로로 자동 전환된다.
비용 절감 및 운영 성과
등급 라우팅 적용 후 2026년 8월 LLM 비용은 최고치였던 6월 대비 78% 감소했다. 이는 medium 등급의 실제 blended 단가가 상한($1)의 1/5 수준인 $0.18로 낮아진 것과 캐시 히트율 80% 이상 유지, 그리고 서비스/기능별 사용량 가시성 확보를 통한 과다 사용 방지 등이 복합적으로 작용한 결과다. 신규 제공 업체 연결은 GitOps Pull Request 1건으로 처리되며, 모델 교체 시에도 게이트웨이 설정 변경 한 번으로 전 서비스에 반영된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.