Convai, 텍스트 생성 없는 결정 모델 'Laya' 공개
Laya: 텍스트 생성 없이 한 번의 순전파로 결정을 내리는 Jev 호환 오픈 가중치 모델과 로컬 실행 도구들
핵심 내용
LLM의 환각과 지연 문제를 해결하기 위해 한 번의 순전파로 확률 분포를 반환하는 Jev 호환 오픈 가중치 모델이다.
자세히 보기
Convai Innovations가 텍스트 생성 과정 없이 한 번의 순전파(forward pass)로 확률 분포를 반환하는 오픈 가중치 결정 모델 Laya를 공개했다. 이 모델은 LLM 기반 에이전트에서 발생하는 토큰 생성 지연, 파싱 오류, 환각 문제를 해결하기 위해 설계되었으며, Jev(TypeSafe AI)의 API 형식과 호환된다.
아키텍처 및 성능
Laya는 ModernBERT-large(영어) 또는 mmBERT-base(다국어) 인코더와 2층 트랜스포머 결정 헤드로 구성된다. 질문 유형에 따라 선택지(choice), 등급(score), 참/거짓(noul) 확률을 반환한다. Tesla T4 기준 질문 1개 처리에 32.8ms, 10개 배치 처리에 72.3ms의 속도를 보인다. 학습에는 RLCD(Reinforcement Learning for Calibrated Decisions) 방식을 적용해 신뢰도 보정을 강화했다.
주요 체크포인트 및 한계
- laya: 영어 전용, 421M 파라미터, 컨텍스트 512
- laya-multilingual: 100개 이상 언어 지원, 322M 파라미터, 영어 버전보다 약 2배 빠름
- laya-typed-decisions: 특정 업무 흐름에 미세조정된 체크포인트
기본 체크포인트는 Zero-shot 성능이 무작위 추측 수준에 가까워 미세조정이 필수적이다. 또한 선택지가 20개를 초과하면 정확도가 급락하는 제한이 있으며, Banking77 벤치마크에서는 Jev 대비 낮은 성능을 보였다. 반면 AG News, DAIR Emotion 등 특정 태스크에서는 Jev보다 높은 정확도를 기록했다.
로컬 실행 생태계
Laya는 Apache-2.0 라이선스로 공개되어 상업적 사용이 가능하며, 다양한 로컬 실행 도구가 함께 제공된다.
- Laya-MLX: Apple Silicon GPU용 MLX 포트. M3 Max에서 다국어 질문 P50 7.39ms
- Laya-CoreML: Apple Neural Engine(ANE) 최적화. M3 Max에서 다국어 질문 P50 4.98ms
- Ollaya: Rust 기반 단일 바이너리. ONNX Runtime을 사용하며 RTX 4090에서 질문 5개 처리에 8~10ms 소요. Laya 외에도 winnow, decider 등 다른 결정 모델을 지원한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.