Nvidia Switchyard Router, 작업 중 AI 모델 재배치로 비용 1/3로 절감
·2026.08.12 09:00
핵심 내용
Nvidia가 Nemotron 3.5 Lightning과 Switchyard를 통해 작업 단계별 최적 모델을 라우팅하여 AI 에이전트 비용을 1/3로 절감했다.
자세히 보기
기업이 AI 에이전트를 운영할 때 발생하는 핵심 문제는 비용과 효율의 트레이드오프다. 모든 작업을 고성능 프런티어 모델에 맡기면 비용이 급증하고, 직접 라우팅 로직을 구축하면 유지보수 부담이 커진다.
Nvidia는 이를 해결하기 위해 고성능 MoE(Mixture-of-Experts) 모델인 Nemotron 3.5 Lightning과 오픈소스 라우팅 라이브러리인 NeMo Switchyard를 공개했다.
주요 성능 및 비용 지표는 다음과 같다:
- Nemotron 3.5 Lightning: 동급 모델 대비 최대 4배 빠른 출력, Qwen3.6-35B 대비 약 30% 빠른 작업 수행
- Switchyard 결합 시: Opus 4.8 단독 사용 대비 비용을 약 1/3 수준으로 절감하면서도 프런티어급 성능 유지
Switchyard의 핵심은 작업의 상태(State)에 따라 실시간으로 모델을 변경하는 것이다. 에이전트가 도구의 결과를 받거나 오류를 마주하는 등 상태가 변할 때마다 최적의 모델을 선택한다. 또한 모델의 **Verbosity(토큰 생성량)**를 예측하여 더 저렴한 모델로 작업을 유도하는 전략도 지원한다.
이 솔루션은 LangChain, Cognition과 같은 에이전트 프레임워크는 물론, OpenRouter, LiteLLM 등 기존 LLM 게이트웨이와도 연동되어 생태계를 확장하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.