AI Briefing

Convai, 텍스트 생성 없는 결정 모델 'Laya' 공개

Laya: 텍스트 생성 없이 한 번의 순전파로 결정을 내리는 Jev 호환 오픈 가중치 모델과 로컬 실행 도구들

·2026.09.29 07:01

핵심 내용

LLM의 환각과 지연 문제를 해결하기 위해 한 번의 순전파로 확률 분포를 반환하는 Jev 호환 오픈 가중치 모델이다.

1 / 5

자세히 보기

Convai Innovations가 텍스트 생성 과정 없이 한 번의 순전파(forward pass)로 확률 분포를 반환하는 오픈 가중치 결정 모델 Laya를 공개했다. 이 모델은 LLM 기반 에이전트에서 발생하는 토큰 생성 지연, 파싱 오류, 환각 문제를 해결하기 위해 설계되었으며, Jev(TypeSafe AI)의 API 형식과 호환된다.

아키텍처 및 성능

Laya는 ModernBERT-large(영어) 또는 mmBERT-base(다국어) 인코더와 2층 트랜스포머 결정 헤드로 구성된다. 질문 유형에 따라 선택지(choice), 등급(score), 참/거짓(noul) 확률을 반환한다. Tesla T4 기준 질문 1개 처리에 32.8ms, 10개 배치 처리에 72.3ms의 속도를 보인다. 학습에는 RLCD(Reinforcement Learning for Calibrated Decisions) 방식을 적용해 신뢰도 보정을 강화했다.

주요 체크포인트 및 한계

  • laya: 영어 전용, 421M 파라미터, 컨텍스트 512
  • laya-multilingual: 100개 이상 언어 지원, 322M 파라미터, 영어 버전보다 약 2배 빠름
  • laya-typed-decisions: 특정 업무 흐름에 미세조정된 체크포인트

기본 체크포인트는 Zero-shot 성능이 무작위 추측 수준에 가까워 미세조정이 필수적이다. 또한 선택지가 20개를 초과하면 정확도가 급락하는 제한이 있으며, Banking77 벤치마크에서는 Jev 대비 낮은 성능을 보였다. 반면 AG News, DAIR Emotion 등 특정 태스크에서는 Jev보다 높은 정확도를 기록했다.

로컬 실행 생태계

Laya는 Apache-2.0 라이선스로 공개되어 상업적 사용이 가능하며, 다양한 로컬 실행 도구가 함께 제공된다.

  • Laya-MLX: Apple Silicon GPU용 MLX 포트. M3 Max에서 다국어 질문 P50 7.39ms
  • Laya-CoreML: Apple Neural Engine(ANE) 최적화. M3 Max에서 다국어 질문 P50 4.98ms
  • Ollaya: Rust 기반 단일 바이너리. ONNX Runtime을 사용하며 RTX 4090에서 질문 5개 처리에 8~10ms 소요. Laya 외에도 winnow, decider 등 다른 결정 모델을 지원한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.