AI Briefing
추천

NVIDIA, LLM 라우팅 오픈소스 'Switchyard' 공개… Opus 대비 비용 최대 30% 절감

·2026.09.12 09:30

핵심 내용

NVIDIA가 LLM 호출을 최적 모델로 자동 라우팅하는 오픈소스 도구 Switchyard를 공개했다.

1 / 2

자세히 보기

NVIDIA가 LLM 호출을 비용과 성능 균형이 가장 좋은 모델로 자동 라우팅하는 오픈소스 프로젝트 Switchyard를 공개했다. 이 도구는 에이전트 코드를 수정하지 않고도 OpenAI/Anthropic API를 그대로 사용하며, 요청의 복잡도에 따라 capable(고성능) 모델과 efficient(저비용) 모델을 지능적으로 선택한다.

주요 기능 및 아키텍처

  • 자동 라우팅: Algorithm이 모델 카테고리(efficient 등)를 선택하고, Driver가 실제 ModelId로 매핑하여 호출한다.
  • 다양한 통합 경로: NeMo Relay 플러그인(Rust 빌드 필요) 또는 라이브러리 임베딩(PyPI 또는 소스 빌드) 방식으로 사용 가능하다. 또한 standalone proxy로 실행하여 localhost:4000에서 /v1/chat/completions 등 표준 API를 제공할 수 있다.
  • 코딩 에이전트 연동: ANTHROPIC_BASE_URL 또는 OPENAI_BASE_URL을 Switchyard 서버 주소로 변경하면 Codex CLI 등 기존 도구에 즉시 적용된다.

성능 벤치마크 (Terminal-Bench 2.1)

NVIDIA 내부 엔드포인트 기반 테스트 결과, 고정 모델 대비 라우팅 알고리즘 사용 시 비용 절감 효과가 두드러졌다.

  • Baseline (Claude Opus 4.8): 정확도 76.0%, 비용 $98.06
  • Escalation 라우팅: 정확도 75.7%, 비용 $85.00 (비용 13.3% 절감)
  • Stage 라우팅: 정확도 72.7%, 비용 $68.19 (비용 30.5% 절감)
  • Capability 라우팅: 정확도 71.2%, 비용 $79.32 (비용 19.1% 절감)

단독 모델 중에서는 Kimi K2.6(55.8%, $76.28)과 GLM 5.2(52.4%, $16.47) 등이 비교 대상이었으나, 라우팅을 통한 복합 전략이 성능과 비용의 트레이드오프를 더 잘 관리하는 것으로 나타났다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.