비용은 줄지 않는다. 이제 무엇을 해야 하는가?
·2026.06.26 20:19
AI 에이전트의 토큰 사용량 급증에 대응하기 위해 품질 저하 없이 비용을 최적화하는 자동화된 라우팅 기술이 중요해지고 있다.
Goldman Sachs에 따르면 token usage는 2030년까지 약 24배 성장할 전망입니다. 이에 따라 AI 리더들의 고민은 '에이전트의 성능'에서 '대규모 운영 시의 비용 감당 가능 여부'로 옮겨가고 있습니다.
현재 기업들은 에이전트 최적화 과정에서 두 가지 주요 난관에 봉착해 있습니다.
- 수동 튜닝의 한계: 매주 새로운 최적화 방법이 등장하며, 수동으로 라우팅 규칙을 설정할 경우 모델 변경이나 워크플로우 변화에 따라 성능과 비용이 오히려 악화될 수 있습니다.
- 모델 업데이트의 영향: 기반 모델이 변경될 때마다 기존의 가격 및 성능 가정이 무용지물이 되어 최적화 노력이 초기화되는 문제가 발생합니다.
이러한 문제를 해결하기 위해 업계는 routing 기술에 집중하고 있습니다. Vercel의 보고서에 따르면, 대규모 운영 팀들은 평균 35개의 모델을 라우팅 그래프로 활용하고 있습니다.
AI21은 이를 자동화하기 위해 intelligent router를 구축하고 있습니다. 이 레이어는 실행 시점에 중복된 컨텍스트나 불필요한 지침 등 token leakage를 감지하여 제거하며, 트래픽이 쌓일수록 학습을 통해 최적의 모델로 요청을 전달하는 고도화된 라우팅 결정을 내립니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.