AI Briefing

Jared Palmer, 0.8B~27B 오픈소스 의사결정 모델 Kev 1.0 공개

·2026.10.01 09:00

핵심 내용

Jared Palmer가 Apache-2.0 라이선스의 오픈소스 의사결정 모델 Kev 1.0을 공개했다.

자세히 보기

Jared Palmer가 Kev 1.0을 공개했다. 0.8B부터 27B까지 네 가지 크기의 오픈소스 의사결정 모델군으로, Kev-27B와 업데이트된 Kev-9B가 포함됐다. 모든 모델은 Hugging Face에서 Apache-2.0 라이선스로 제공된다. 각 답변 옵션에 대한 확률을 산출하도록 설계됐으며, TypeSafe의 Jev API와 호환돼 엔드포인트와 모델명 변경이 쉽다.

모델 성능 및 아키텍처

Kev-27B가 종합 평가에서 최상위 성능을 기록했으며, Kev-9B와 Kev-4B는 소비자 불만 처리에서 1%포인트 이내, 개발자 도구 의사결정에서는 동등한 성능을 보였다. 이 모델들은 pointer head를 사용해 제공된 답변 옵션을 직접 점수화하며, 답변 생성을 위한 토큰 생성을 생략한다. 이 구조로 문서를 한 번만 처리하고 각 질문은 캐시된 계산을 활용하므로, 동일 문서에 대한 다중 질의 시 지연 시간이 크게 줄어든다.

주요 성능 지표:

  • Kev-27B: 종합 결과 최상, 긴 문서 처리 시 H200 또는 B200 필요.
  • Kev-9B: H100 등 소형 GPU에서 Kev-27B와 유사한 워크플로 정확도.
  • Kev-4B: 로컬 사용 및 파인튜닝에 적합, L40S 또는 32GB Mac에서 실행 가능.
  • Kev-0.8B: 고처리량, 좁은 범위의 의사결정에 적합, L4 또는 Apple Silicon Mac에서 실행 가능.

학습 및 평가

Kev-27B는 Qwen3.8-27B를 기반으로 파인튜닝됐으며, 약 146,000개 예제와 337,000개 질문으로 구성된 더 넓은 코퍼스를 사용했다. 학습에는 톤, 근거 기반성, 프롬프트 인젝션, 개인 데이터 감지 관련 예제가 포함됐다. Kev-9B는 정책 추론 및 개발자 도구 의사결정 격차를 좁히기 위해 추가 파인튜닝을 거쳤고, 정책 작업 정확도가 **58%**에서 **83%**로 향상됐다.

평가 결과는 저자의 하네스 기준이며 독립적인 리더보드 결과가 아니다. Kev-27B는 신뢰도 점수가 실제 정확도와 밀접하게 일치하는 강력한 캘리브레이션을 보여준다. 일반화 능력 평가를 위해 파인튜닝에서 제외된 작업으로 테스트했으며, Kev-27B는 확률 보정 지수에서 52.3점을 기록해 Kev-9B의 41.0점보다 높았다.

배포 및 파인튜닝

이번 릴리스에는 Claude Code 및 Codex 같은 코딩 에이전트와 호환되는 파인튜닝 및 배포용 공식 스킬이 포함됐다. Kev-4B는 약 $1의 GPU 비용으로 맞춤형 데이터에 파인튜닝할 수 있다. MLX를 통해 Apple Silicon에서 로컬 실행을 지원하며, 32GB M5 Mac에서 Kev-4B가 짧은 텍스트에 대한 5개 질문에 721 ms로 응답한다. 제공된 스킬을 사용하면 인증된 HTTPS 엔드포인트로 Kev를 Modal에 배포할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.