AI Briefing

openjev: 텍스트 생성 없이 분류 확률만 뽑아 5배 빠르게

TheoLeeCJ/openjev

·2026.09.17 23:44

에이전트가 라우팅이나 재시도 여부를 판단할 때, LLM이 문장을 생성하고 파싱하는 비효율을 제거한다. 모델의 로짓을 직접 읽어 선택지별 확률을 즉시 반환하는 방식으로, 답변 생성 과정을 생략한다.

Qwen3.5-4B 모델을 RTX 3090에서 구동하면 21개 기준 판단에 약 1초가 소요된다. 기존 JSON 배열 생성 방식 대비 5배 이상 빠르며, 상태 정보를 미리 로드해 병렬 처리하면 초당 20개 이상의 결정을 내릴 수 있다.

TypeSafe의 폐쇄형 서비스 Jev와 유사한 인터페이스를 오픈 모델로 재현했다. 브라우저에서 바로 실행 가능한 WebGPU 데모를 제공하며, 복잡한 설치 없이 분류 성능을 검증할 수 있다.

GitHub
GitHub 저장소

TheoLeeCJ/openjev

Can we run something like Jev on a 3090 at home?

Python

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.