CLM-v0.1-8B 공개, Jev 대비 13배 빠른 의사결정
CLM(Contrastive LM), 대조 학습을 통해 Jev와 같은 형식으로, 상태에 맞는 행동을 빠르게 선택하는 언어 모델
핵심 내용
Qwen3-8B 기반 CLM-v0.1-8B 공개, 후보 행동 선택 속도 Jev 대비 최대 13배 향상
자세히 보기
2026년 9월 23일, 상태와 행동을 벡터화하여 유사도 기반으로 최적의 행동을 빠르게 선택하는 CLM(Contrastive Language Model) v0.1-8B가 공개되었습니다. 이 모델은 자유 생성 대신 후보 중 최고 점수를 반환하는 System One 방식의 의사결정 구조를 채택했습니다.
구조 및 학습
CLM-v0.1-8B는 Qwen3-8B를 인코더로 사용하며 가중치는 고정된 상태로, 상태와 행동 임베딩을 위한 작은 Projection Head만 추가 학습되었습니다. 양방향 InfoNCE Loss를 통해 정답 쌍은 가깝게, 배치 내 다른 조합은 멀어지도록 최적화됩니다. 학습 데이터는 Nemotron DQA, 합성 하드 네거티브, 에이전트 궤적 등을 포함하며, 하드 네거티브 학습을 통해 top-1 정확도가 약 7%p 향상되었습니다.
성능 및 속도
행동 벡터를 사전 계산하여 캐싱할 수 있어, 1,000개 후보 비교 시 Jev 대비 약 13배 빠른 추론 속도를 달성합니다. 제로샷 평가에서 T-Rex 기준 지연 시간은 16.5ms로 Jev(149.8ms)보다 약 9배 낮으며, 성공률은 유사한 수준을 유지합니다. 코딩 검증기 평가에서는 DeepSWE 기준 성공률 81.6%로 Jev(71.1%)를 상회했습니다.
배포 및 향후 계획
Apache 2.0 라이선스로 공개되며, vLLM의 Qwen3-8B 풀링 모드와 CLM API 서버를 통해 배포됩니다. 헤드 다운로드 크기는 75MB입니다. 향후 멀티모달 CLM-35B 학습을 진행 중이며 2026년 10월 초 공개 예정입니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.