AI Briefing

비용 효율적인 LLM 라우팅을 위한 온라인 학습

·2026.07.21 09:00

Ramp이 온라인 학습 기반 동적 LLM 라우팅으로 AI 비용을 25% 이상 절감하고 오류율도 낮췄다.

Ramp은 하루 수조 개의 토큰을 처리하는 내부 LLM 게이트웨이를 운영하며, 모델 및 서비스 티어 간 동적 라우팅을 통해 AI 비용을 25% 이상 절감하는 동시에 오류율도 줄이는 데 성공했다.

출발점은 OpenAI의 flex 티어가 항상 default보다 지연이 높지 않다는 관찰이었다. 실제로 업무 시간(9~5시)에는 flex 티어 지연이 급격히 증가하지만, 그 외 시간대에는 default와 큰 차이가 없었다. 이 패턴이 고정적이지 않아 정적 규칙으로는 대응이 불가능했다.

핵심 설계 원칙은 세 가지다:

  • 신뢰성이 최우선 — 프로바이더 장애, 레이트 리밋 등 다양한 실패에 대응
  • **지연(latency)**은 호출 목적에 따라 중요도가 다름 (백그라운드 자동화 vs. 사용자 대면 UI)
  • 호출자는 모델 우선순위 목록을 게이트웨이에 전달해 선호도를 표현

이를 하나의 라우팅 전략으로 인코딩하기 위해 실시간 지연·실패 분포를 온라인 학습으로 추적하는 방식을 채택했다. 고정된 규칙 대신 실측 데이터를 지속적으로 반영해 최적 라우팅 결정을 내린다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.