추천
NVIDIA, LLM 라우팅 오픈소스 'Switchyard' 공개… Opus 대비 비용 최대 30% 절감
·2026.09.12 09:30
핵심 내용
NVIDIA가 LLM 호출을 최적 모델로 자동 라우팅하는 오픈소스 도구 Switchyard를 공개했다.
1 / 2
자세히 보기
NVIDIA가 LLM 호출을 비용과 성능 균형이 가장 좋은 모델로 자동 라우팅하는 오픈소스 프로젝트 Switchyard를 공개했다. 이 도구는 에이전트 코드를 수정하지 않고도 OpenAI/Anthropic API를 그대로 사용하며, 요청의 복잡도에 따라 capable(고성능) 모델과 efficient(저비용) 모델을 지능적으로 선택한다.
주요 기능 및 아키텍처
- 자동 라우팅: Algorithm이 모델 카테고리(efficient 등)를 선택하고, Driver가 실제 ModelId로 매핑하여 호출한다.
- 다양한 통합 경로: NeMo Relay 플러그인(Rust 빌드 필요) 또는 라이브러리 임베딩(PyPI 또는 소스 빌드) 방식으로 사용 가능하다. 또한 standalone proxy로 실행하여
localhost:4000에서/v1/chat/completions등 표준 API를 제공할 수 있다. - 코딩 에이전트 연동:
ANTHROPIC_BASE_URL또는OPENAI_BASE_URL을 Switchyard 서버 주소로 변경하면 Codex CLI 등 기존 도구에 즉시 적용된다.
성능 벤치마크 (Terminal-Bench 2.1)
NVIDIA 내부 엔드포인트 기반 테스트 결과, 고정 모델 대비 라우팅 알고리즘 사용 시 비용 절감 효과가 두드러졌다.
- Baseline (Claude Opus 4.8): 정확도 76.0%, 비용 $98.06
- Escalation 라우팅: 정확도 75.7%, 비용 $85.00 (비용 13.3% 절감)
- Stage 라우팅: 정확도 72.7%, 비용 $68.19 (비용 30.5% 절감)
- Capability 라우팅: 정확도 71.2%, 비용 $79.32 (비용 19.1% 절감)
단독 모델 중에서는 Kimi K2.6(55.8%, $76.28)과 GLM 5.2(52.4%, $16.47) 등이 비교 대상이었으나, 라우팅을 통한 복합 전략이 성능과 비용의 트레이드오프를 더 잘 관리하는 것으로 나타났다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.