AI Briefing
추천

Jev 대안 CLM 공개, 에이전트 의사결정 4배 빨라

JEV almost dead: CLM vs JEV

·2026.09.24 15:40

핵심 내용

Qwen3 기반 CLM이 Jev의 모든 기능을 지원하며 Terminal-Bench에서 87.6%의 성능을 기록했다.

자세히 보기

TypeSafe AI의 폐쇄형 의사결정 모델 Jev를 대체하기 위한 오픈 웨이트 모델 **CLM(Contrastive Language Models)**이 공개되었습니다. CLM은 Qwen3-8B를 기반으로 하며, Jev와 동일한 API 및 기능적 인터페이스를 제공합니다.

성능 및 아키텍처 개선

CLM은 상태 헤드(state head)와 액션 헤드(action head)를 분리하는 아키텍처를 채택하여, 반복적인 액션 임베딩을 캐싱할 수 있습니다. 이를 통해 인터랙티브 브라우저 에이전트 및 게임 환경 벤치마크에서 Jev 대비 4배에서 13배 빠른 지연 시간을 달성했습니다. 또한 약 75MB의 작은 파라미터 크기로 인해 사용자의 에이전트 궤적(agent trajectories)에 맞춰 파인튜닝이 가능합니다.

벤치마크 결과

파인튜닝된 CLM은 코딩 벤치마크 검증기(verifier) 성능에서 최신 기술 수준(state-of-the-art)을 기록했습니다.

  • Terminal-Bench 2.1: 87.6%
  • DeepSWE: 81.6%

반면, 제로샷(zero-shot) 방식의 Jev는 DeepSWE에서 약 71%의 점수를 기록하며 상대적으로 낮은 성능을 보였습니다.

한계 및 차이점

CLM은 Jev의 모든 핵심 프미티브(Choice, Noul, Score)를 지원하지만, 몇 가지 제한 사항이 존재합니다.

  • 일반화 능력: 제로샷 오픈 도메인 작업에서는 Jev가 더 높은 정확도를 보입니다 (예: Berkeley Function Calling Leaderboard v4에서 Jev 99.2% vs CLM-8B 95.2%).
  • 컨텍스트 길이: Jev는 64K 토큰 컨텍스트를 기본 지원하지만, CLM-8B는 2K~8K 컨텍스트에서 검증 및 캘리브레이션되었습니다.
  • 확률 정규화: CLM의 확률은 요청 시 제공된 후보 집합에 대해 상대적인 반면, Jev는 절대적 기준에 대해 내부적으로 캘리브레이션된 점수를 제공합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.