카카오, Minitron 기반 압축 기술로 Kanana Nano 시리즈 개발
핵심 내용
Kanana Nano-2.1B는 크기를 26% 줄였음에도 Kanana Essence의 93% 한국어 성능을 유지했다.
자세히 보기
카카오 카나나 알파 조직이 Pruning과 Distillation 기술을 활용해 비용 효율적인 소형 언어모델(SLM) 시리즈 Kanana Nano를 개발했다. 기존 Kanana Essence 모델에서 시작해 Minitron 방법론을 채택 및 발전시켜, 유사 크기의 Llama 3.2, Gemma 2 대비 영어 성능은 비슷하거나 우위이며 한국어 성능은 압도적으로 높게 달성했다.
압축 전략 및 성능
모델 크기를 26%로 줄인 Kanana Nano-2.1B는 원본 모델의 93%에 달하는 한국어 성능을 유지했다. 한두 단계 압축에 그친 기존 연구와 달리, 5~6단계의 반복적인 Pruning과 Distillation을 거쳐 모바일용 초소형 모델까지 유의미한 성능을 확보했다. 특히 Grouped-Query Attention(GQA) 구조에서 Key/Value를 공유하는 Query head를 묶어 제거하는 방식이 효과적이었으며, 소형 모델로 갈수록 임베딩 파라미터 비중이 커지는 문제를 해결하기 위해 입출력 임베딩을 평균하여 Tie하는 기법을 적용했다.
임베딩 모델 개발
LLM2Vec 방법론을 적용해 Decoder-only 모델을 Encoder로 변환한 한국어 임베딩 모델도 공개했다. 양방향 Attention 활성화, Masked Next Token Prediction, Contrastive learning 단계를 거친 결과, MTEB 벤치마크에서 한국어 Retrieval 작업 시 Qwen 2.5 및 Llama 3.2 대비 우수한 성능을 보였다. 특히 Pruning된 Kanana Nano 기반 임베딩 모델이 전반적으로 더 높은 점수를 기록했다.
향후 계획 및 공개
현재 Kanana Nano-2.1B와 이를 기반으로 한 Instruct, Embedding 모델은 추후 오픈소스로 공개될 예정이다. 카카오는 코드 및 수학 등 부족한 도메인의 데이터 보강과 Pruning으로 인한 정보 손실을 최소화하는 기술 연구를 지속할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.