LangSmith, Jev 평가 모델 추가… LLM 대비 최대 450배 저렴·200배 빠른 에이전트 평가
·2026.09.22 01:00
핵심 내용
LangSmith가 TypeSafe AI의 Jev 모델을 도입해 LLM 대비 최대 450배 저렴하고 200배 빠른 에이전트 평가를 지원한다.
1 / 6
자세히 보기
LangSmith가 TypeSafe AI의 Jev 모델을 평가 도구로 추가했다. Jev는 텍스트 생성 없이 구조화된 결정을 내리는 System One 모델로, LLM-as-a-judge의 유연성과 code-based 평가의 속도 사이에서 균형을 맞춘다.
성능 및 비용 효율성
TypeSafe AI의 벤치마크에 따르면 Jev는 분류 작업 기준 LLM 대비 최대 450배 저렴하고 200배 빠르다. GPT-5.6 Luna, GPT-5.6 Terra, Claude Sonnet 4.6과의 비교에서 Jev는 정확도와 일관성, 속도, 비용 모두에서 우위를 보였다.
- 속도: Jev 평균 0.44초/호출 vs LLM judges 2.16-2.83초
- 비용: 전체 판정 기준 Jev $0.34 ($0.00035/호출) vs Claude Sonnet 4.6 $28.17
- 일관성: LLM judge 대비 분산(variance)이 92-913배 낮음
작동 방식 및 활용
Jev는 noul(yes/no 확률), choice(선택지), score(척도) 등 3가지 질문 유형을 지원한다. 단일 요청 내에서 모든 질문을 병렬로 평가하므로 다중 기준(PII, 의도 등)을 검증할 때 추가 비용과 시간이 거의 들지 않는다.
- 설정: LangSmith Settings에서 TypeSafe API 키 등록 후, Evaluators 탭에서 Provider를 TypeSafe, Model을
jev-latest로 선택 - 주의사항: 현재 TypeSafe는 zero data retention을 제공하지 않아 평가 데이터가 프로바이더에 저장될 수 있음
Jev는 open-ended한 추론이 필요한 경우보다는 narrow하고 typed된 결정을 대량으로 수행할 때 적합하며, 기존 LLM judge를 완전히 대체하기보다는 보완하는 역할을 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.