AI Briefing

Convai, 비자기회귀형 의사결정 모델 Laya 공개

convaiinnovations/laya (multilingual, non-autoregressive System 1 decision model)

·2026.09.21 11:33

핵심 내용

Convai Innovations가 텍스트 생성 없이 상태를 분류하는 비자기회귀형 다국어 의사결정 모델 Laya를 오픈소스로 공개했다.

자세히 보기

Convai Innovations가 TypeSafe의 Jev API에 대한 오픈소스 대안으로 비자기회귀형(non-autoregressive) 의사결정 모델 Laya를 Apache 2.0 라이선스로 공개했다. 이 모델은 텍스트 생성 대신 입력 상태와 유형화된 질문을 받아 단일 순방향 패스로 결과를 반환하며, GPU 기준 33~40ms의 빠른 응답 속도를 제공한다.

주요 특징 및 아키텍처

Laya는 출력 파싱이나 환각(hallucination) 위험 없이 라벨 선택, 서열 점수 매기기, 예/아니오 확률 예측 등을 수행하도록 설계되었다. 모델은 세 가지 체크포인트로 구성된다:

  • 421M 파라미터 영어 모델: ModernBERT-large 기반
  • 322M 파라미터 다국어 모델: mmBERT-base 기반, 100개 이상 언어 지원
  • 유형화된 의사결정 워크플로우용 미세 조정 변형

내장된 Router가 입력 스크립트를 감지하여 적절한 체크포인트로 라우팅한다. 학습에는 엄격한 proper scoring rules를 보상 함수로 사용하는 강화학습 방법론인 RLCD가 적용되어, 모델이 정직한 확률을 보고하도록 유도한다. 또한 인간에게 에스컬레이션할 시점을 판단하는 act-vs-escalate 헤드도 포함된다.

성능 및 한계점

개발자는 AG News, 감정 분류, 유형화된 의사결정 벤치마크에서 Jev보다 우수한 성능을 기록했으며, 실행 속도는 약 6~8배 빠르다고 보고했다. 다만 Jev와의 비교 수치는 제3자 데이터이며 직접적인 헤드투헤드 테스트 결과는 아니다. 모델 카드는 다음과 같은 한계를 명시했다:

  • 기본 체크포인트는 미세 조정 없이 유형화된 의사결정에서 무작위 추측 수준에 가까움
  • 선택지가 50개 이상일 때 정확도가 급격히 하락 (Banking77 기준 Laya 0.425 vs Jev 0.870)
  • 서열 점수 매기기(ordinal scoring)가 가장 취약한 영역
  • 영어 체크포인트는 비라틴 문자에서 실패
  • 모델이 과도하게 확신하는 경향이 있어, 신뢰할 수 있는 확률을 얻으려면 자체 데이터에 대해 temperature를 조정해야 함

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.