AI Briefing

Weave Router, 로컬 임베딩 기반 LLM 라우팅 공개

Weave Router: 코딩 에이전트의 요청마다 로컬 임베딩으로 모델을 골라 주는 LLM 라우팅 프록시

·2026.08.28 21:30

핵심 내용

Weave가 로컬 임베딩 모델을 활용해 코딩 에이전트의 API 요청마다 최적의 LLM을 자동 선택하는 오픈소스 라우팅 프록시 Weave Router를 공개했다.

1 / 2

자세히 보기

코딩 에이전트는 한 번의 사용자 입력에 대해 파일 읽기, 명령 실행 등 여러 단계의 API 요청을 생성하며, 이 과정에서 비용이 급증하는 문제가 있다. Weave Router는 이러한 요청 단위로 적절한 모델을 자동 선택하는 라우팅 프록시다.

로컬 임베딩 기반 결정 구조

Weave Router는 별도 LLM 호출이나 규칙 기반 설정 대신, 라우터 프로세스 내에서 실행되는 작은 임베딩 모델을 사용한다. 요청 텍스트를 임베딩 벡터로 변환한 뒤, 미리 계산된 클러스터 중심(Centroid)과 비교하여 해당 클러스터의 순위표에서 모델을 선택한다. 이 방식은 Avengers-Pro 논문에서 파생된 클러스터 채점 방식을 따르며, 요청당 라우팅 판단이 50ms 이내로 완료되고 비용을 40~70% 절감한다고 Weave는 밝혔다.

주요 기능 및 설계 특징

  • 결정 단위(Action): 세션이나 턴이 아닌, 에이전트가 상위 모델에 보내는 개별 API 요청(Action)을 결정 단위로 본다. 단, 대화 일관성을 위해 세션의 첫 라우팅 결과를 고정하는 옵션이 기본 활성화된다.
  • 임베더 옵션: Jina AI의 INT8 양자화 모델(jina-embeddings-v2-base-code) 또는 Qwen3-Embedding-0.6B 변환본 중 하나를 선택할 수 있다. 두 모델 모두 공개 저장소에서 다운로드 가능하다.
  • 명시적 실패 처리: 임베딩 모델 부재나 시간 초과 시 조용히 기본 모델로 넘기지 않고 HTTP 503을 반환하여 문제를 즉시 감지할 수 있게 설계되었다(Failures are loud by design).
  • 배포 및 사용: Go 1.25 이상에서 빌드되며, 자체 호스팅 또는 Weave의 관리형 서비스로 운영할 수 있다. Claude Code, Codex CLI 등 주요 에이전트 도구와 연동되는 설치 스크립트를 제공한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.