AI Briefing

LangSmith, Jev 평가 모델 추가… LLM 대비 최대 450배 저렴·200배 빠른 에이전트 평가

·2026.09.22 01:00

핵심 내용

LangSmith가 TypeSafe AI의 Jev 모델을 도입해 LLM 대비 최대 450배 저렴하고 200배 빠른 에이전트 평가를 지원한다.

1 / 6

자세히 보기

LangSmith가 TypeSafe AI의 Jev 모델을 평가 도구로 추가했다. Jev는 텍스트 생성 없이 구조화된 결정을 내리는 System One 모델로, LLM-as-a-judge의 유연성과 code-based 평가의 속도 사이에서 균형을 맞춘다.

성능 및 비용 효율성

TypeSafe AI의 벤치마크에 따르면 Jev는 분류 작업 기준 LLM 대비 최대 450배 저렴하고 200배 빠르다. GPT-5.6 Luna, GPT-5.6 Terra, Claude Sonnet 4.6과의 비교에서 Jev는 정확도와 일관성, 속도, 비용 모두에서 우위를 보였다.

  • 속도: Jev 평균 0.44초/호출 vs LLM judges 2.16-2.83초
  • 비용: 전체 판정 기준 Jev $0.34 ($0.00035/호출) vs Claude Sonnet 4.6 $28.17
  • 일관성: LLM judge 대비 분산(variance)이 92-913배 낮음

작동 방식 및 활용

Jev는 noul(yes/no 확률), choice(선택지), score(척도) 등 3가지 질문 유형을 지원한다. 단일 요청 내에서 모든 질문을 병렬로 평가하므로 다중 기준(PII, 의도 등)을 검증할 때 추가 비용과 시간이 거의 들지 않는다.

  • 설정: LangSmith Settings에서 TypeSafe API 키 등록 후, Evaluators 탭에서 Provider를 TypeSafe, Model을 jev-latest로 선택
  • 주의사항: 현재 TypeSafe는 zero data retention을 제공하지 않아 평가 데이터가 프로바이더에 저장될 수 있음

Jev는 open-ended한 추론이 필요한 경우보다는 narrow하고 typed된 결정을 대량으로 수행할 때 적합하며, 기존 LLM judge를 완전히 대체하기보다는 보완하는 역할을 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.