PostHog, 추론 강화 의사결정 모델 Jeeves 공개… JevBench 0.935 달성
핵심 내용
PostHog가 추론 강화 모델 Jeeves를 공개해 JevBench에서 0.935점을 달성했다.
자세히 보기
PostHog가 추론 능력을 강화한 오픈소스 의사결정 모델 Jeeves를 공개했다. Qwen3.5-9B를 기반으로 LoRA 미세 조정과 전용 포인터 헤드를 적용해 Jev 아키텍처를 개선했으며, Jev API 호환성을 유지하면서 예/아니오, 객관식, 평점 질의를 단일 요청으로 처리한다.
성능 벤치마크
Jeeves는 기준 모델인 Jev와 Kev-9B 대비 의사결정 정확도와 보정(Calibration)에서 상당한 향상을 보였다.
- JevBench 전체 (231개 항목): Jeeves 0.935 vs Jev 0.866
- JevBench 난이도 상 (111개 항목): Jeeves 0.865 vs Jev 0.730
- 테스트 전체 (Out-of-domain): Jeeves 0.889 vs Jev 0.857, Kev-9B 0.822
- 보정 오차 (ECE): Jeeves 0.037로 Jev의 0.049보다 낮음
규칙 기반 및 대조적 정책 작업에서는 1.000의 점수를 기록하며 강점을 보였으나, 순수 지식 검색 능력에서는 Jev보다 낮은 점수를 기록했다. MMLU는 0.793 vs 0.900, MMLU-Pro는 0.739 vs 0.840으로 나타났다.
아키텍처 및 추론 효율
모델은 추론 속도를 높이기 위해 block-4 diffusion drafter를 활용한다. 단일 질문 기준 176 tokens/sec (그리디 디코딩 대비 1.6배 가속)를 달성하며, 배치 처리 시 약 960 tokens/sec의 속도를 낸다. 포인터 헤드는 의사결정 토큰의 숨겨진 상태(hidden state)와 옵션 키 투영(key projections) 간의 스케일링된 내적(scaled dot products)으로 점수를 계산한다.
- 지연 시간: 추론 없이 중위 지연 시간 ~0.3s, 전체 추론 포함 시 3.3s (p90 꼬리 시간 17.1s)
- 추론 영향: 추론 체인 포함 시 테스트 분할 정확도가 0.804에서 0.840으로 향상
- 최적화:
max_think와nothink_threshold파라미터로 정확도와 속도 균형 조절 가능. 예컨대 사고 토큰을 768로 제한하면 중위 지연 시간이 2.0s로 줄고 정확도는 0.806으로 소폭 하락
학습 및 한계
Jeeves는 SFT (2 에폭, 19,126개 질문) 후 CISPO 강화 학습을 통해 훈련되었으며, 과도한 날카로움(over-sharpening)을 방지하기 위해 402단계에서 조기 종료했다. 주요 한계로는 복잡한 추론 시 높은 꼬리 지연 시간과 언어 일관성 보상 부재로 인한 사고 체인의 해석 가능성 감소가 있다. 프로젝트 실행에는 Python 3.12와 CUDA GPU (FP8 커널을 위해 Hopper 아키텍처 권장)가 필요하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.