Jeff 오픈 웨이트 모델, 30ms 지연으로 Jev 벤치마크 상회
Trained locally: ultra-fast 0.8B/2B System 1 decision models that match Jev on benchmarks and Doom, ~30 ms per decision (open weights)
핵심 내용
오픈 웨이트 Jeff 모델이 로컬 하드웨어에서 30ms 지연으로 Jev 벤치마크를 상회했다
자세히 보기
Qwen3.5와 Gemma를 파인튜닝한 오픈 웨이트 모델 Jeff가 공개되었습니다. M4 Max 기준 28 ms의 초저지연으로 제로샷 분류를 수행하며, 텍스트 생성 없이 단일 순전파로 다중 선택 시나리오의 보정된 확률을 제공하는 'System 1' 의사결정에 특화되었습니다.
벤치마크 성능
Jeff-Qwen3.5-2B 모델은 BBH, Financial PhraseBank, JudgeBench, RAGTruth, WinoGrande 등 5개 벤치마크에서 평균 **83.1%**의 점수를 기록해, 더 큰 Jev 모델의 공개 점수 **83.0%**를 근소하게 상회했습니다. 더 작은 Jeff-Qwen3.5-0.8B는 **79.1%**를 기록했습니다.
- 보정(Calibration): 2B 모델의 보정 오차는 0.028로, Jev의 ≈0.06보다 낮습니다.
- 분류 대 추론: Jeff는 분류 작업(예: Financial PhraseBank 96%)에서 강점을 보이지만, 다단계 추론(예: BBH 64–68%)에서는 Jev(94%)보다 성능이 떨어집니다.
학습 및 인프라
모든 학습과 데이터 생성은 클라우드 의존성 없이 로컬 하드웨어에서 수행되었습니다.
- 학습: 단일 RTX PRO 6000(96GB VRAM)에서 진행했으며, 0.8B 모델은 2시간, 2B 모델은 3.5시간이 소요되었습니다.
- 합성 데이터: 약 31k개의 합성 학습 질문이 생성되었으며, 두 대의 DGX Sparks에서 실행 중인 Qwen3.8-Flash-Next가 이를 검증했습니다.
- 데이터셋: 최종 학습 세트에는 의사결정 형식으로 변환된 공개 데이터셋과 합성 데이터가 포함되었습니다.
실질적 시사점
저자는 이 소형 모델들이 계획자(planner)가 아닌 분류기(classifier)로 기능한다고 강조합니다. 게임 기반 제로샷 테스트(Doom, Frogger, Pac-Man)에서 Jeff 0.8B 모델은 2B 변형을 능가했으며, Jev의 공개 Doom 점수(6.55 kills)와 동등한 성능을 ~29 ms의 의사결정 지연으로 달성했습니다. 이는 Jev의 ~212 ms API 지연보다 훨씬 빠릅니다. 모델은 Apache 2.0 라이선스로 배포되며 Jev 호환 API를 제공합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.