Jev 결정 모델 재현 및 성능 비교 분석
Jev와 유사한 오픈소스 결정 모델에 대한 정리: Decision Index와 JevBench로 비교한 결정 모델 성능 비교
핵심 내용
오픈 모델 중 Jev를 넘은 모델은 없으나 JevBench에서는 Cygnet이 상위 점수를 기록함
자세히 보기
TypeSafe AI의 결정 모델 Jev를 재현하고 성능을 비교한 커뮤니티 프로젝트 'Jev Decision Index'와 'JevBench' 결과가 공개되었습니다. Jev는 문장 생성 없이 확률만 반환하는 API 전용 모델로, 가중치가 비공개되어 있어 오픈소스 생태계에서는 다양한 재현 시도가 이루어지고 있습니다.
Decision Index: 정확도 중심 비교
Jev Decision Index 0.2.1 기준, Jev의 점수는 57.91로 가장 높았습니다. 가장 가까운 오픈 모델은 Surogate Rune 26B-A4B v3(57.44)와 Decider chat(57.33)이었으며, 현재까지 Jev의 정확도를 넘어서는 오픈 모델은 없는 것으로 나타났습니다. 다만, Jev는 지식/추론 영역에서 강세를 보였으나 나머지 4개 영역에서는 오픈 모델이 더 높은 점수를 기록했습니다.
JevBench: 비용과 속도 고려
비용과 속도를 포함하는 JevBench v1.5.7에서는 순위가 달라졌습니다. Cygnet(73.7)과 Winnow-12B Q8(73.2)이 Jev(72.1)보다 높은 공식 점수를 기록했습니다. Cygnet은 Gemma 4 12B 기반 미학습 모델로, Jev보다 저렴한 비용($0.028/1k)으로 경쟁력 있는 성능을 보였습니다. Winnow-12B는 파인튜닝된 모델로 RTX 5070 Ti 환경에서 테스트되었습니다.
Image JevBench 및 한국어 지원 현황
이미지 입력을 지원하는 Image JevBench에서는 Jev가 이미지 입력을 지원하지 않아 제외되었습니다. 오픈 모델 중에서는 Imajev-4B(76.39)가 종합 2위를 기록했습니다. 또한, 모든 리더보드는 영어 데이터 기반으로 평가되었으며, 한국어 지원 모델은 Decision Index 등재 모델 70개 중 2개에 불과하여 한국어 업무 적용 시 자체 데이터 기반의 재평가가 필요합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.