Ollaya, 오픈소스 의사결정 모델용 로컬 런타임 출시… TypeSafe SDK 호환 및 8~10ms 지연 시간 지원
핵심 내용
Ollaya가 오픈소스 의사결정 모델용 로컬 런타임을 출시해 NVIDIA GPU에서 8~10ms 지연 시간과 TypeSafe SDK 호환성을 제공한다.
자세히 보기
Ollaya가 오픈소스 의사결정 모델을 로컬에서 실행할 수 있는 런타임을 출시했다. Convai Innovations의 Laya, Mapika의 Decider, Moritz Laurer의 NLI, Knowledgator의 gliclass 등 구조화된 질문(선택지, 점수, 예/아니오)에 대해 토큰 생성 없이 단일 순방향 패스로 답변하는 모델들을 지원한다.
성능 및 지연 시간
호스팅 서비스 대비 지연 시간을 크게 줄였다. NVIDIA RTX 4090에서 Laya 모델로 5개 질문을 처리하는 데 약 8~10ms가 소요된다. 이는 네트워크 오버헤드를 포함한 제3자 벤치마크 기준 호스팅 TypeSafe Jev API의 중앙값 지연 시간 236~276ms와 비교된다. 출처에서는 설정 차이가 있어 이 비교는 자릿수(order-of-magnitude) 추정치임을 명시했다.
API 호환성
Ollaya는 호스팅 Jev 서비스의 대체재(drop-in replacement)로 설계됐다. TypeSafe Python SDK 0.7.1과 호환되며, 환경 변수 설정만으로 요청을 로컬 서버(기본값 127.0.0.1)로 라우팅할 수 있어 코드 변경이 최소화된다.
캘리브레이션 및 프라이버시
모델은 캘리브레이션된 확률을 제공한다. Laya의 온도 피팅 후 기대 캘리브레이션 오차(ECE)는 0.081로, Jev의 0.246보다 낮다. 데이터는 로컬에 유지되며, 가중치는 저자의 Hugging Face 저장소에서 가져와 SHA256 해시로 검증된다. 런타임은 Apache-2.0 라이선스를 따르며 macOS, Windows, Linux, Docker를 지원하고 NVIDIA GPU(CUDA 13) 가속 추론을 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.