모두가 LLM router를 만들고 있지만, 우리는 이를 폐기했다
·2026.08.01 03:06
Manifest가 7,000개 클라우드 사용자 경험을 바탕으로 LLM router를 폐기했다.
Manifest는 지난 3월 LLM gateway의 핵심 기능으로 출시한 LLM router를 6월 deprecated했으며, 9월 1일 완전히 종료했다. 이 router는 요청을 simple·standard·complex·reasoning의 네 복잡도 등급으로 분류해 적합한 모델로 라우팅하는 방식이었다.
약 4개월간 7,000명의 클라우드 사용자를 대상으로 운영한 결과, 비용 절감 효과보다 다음과 같은 문제가 더 크다고 판단했다.
- 프롬프트만으로 작업 복잡도를 판단하기 어렵다. 실제 난이도는 이후의 tool call, web search, 저장소 규모와 같은 맥락에서 드러난다. 같은 코드 개선 요청도 개인 웹사이트와 Linux kernel에서는 복잡도가 크게 다르다.
- 캐시가 routing보다 비용 절감에 효과적이다. 캐시된 입력은 uncached input보다 75~90% 저렴하며, system prompt와 대화 기록에 prefix cache를 적용하면 큰 비용을 줄일 수 있다. 캐시 효율을 위해서는 처음 선택한 모델을 계속 사용하는 것이 유리해 routing의 효과가 약해진다.
- 모델 변경은 동작 일관성을 해친다. 작업 중 모델이 바뀌면 결과 품질이 흔들리고, 엔지니어가 모델별 특성과 trade-off를 익히기 어려워진다.
- 예측 불가능성의 운영 비용이 크다. agentic workflow에서는 eval, system prompt, observability 등을 모델별로 관리해야 하므로 routing으로 아낀 비용보다 유지보수 비용이 커질 수 있다.
Manifest는 대부분의 사용 사례에서 요청별로 모델·파라미터·프롬프트를 명시적으로 설정하고, 하나의 검증된 모델을 일관되게 사용하는 편이 더 낫다고 결론 내렸다. 다만 모든 사용 사례에서 LLM routing이 무의미하다고 주장하는 것은 아니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.