카카오, 활성 파라미터 3B로 Dense 8B급 성능 구현한 MoE 모델 'Kanana-1.5-15.7B-A3B' 공개
·2025.07.24 00:00
핵심 내용
카카오가 MoE 구조를 적용해 활성 파라미터 3B로 Dense 8B 모델과 대등한 성능을 달성한 'Kanana-1.5-15.7B-A3B'를 오픈소스로 공개했다.
1 / 12
자세히 보기
카카오 카나나 LLM 조직은 추론 효율성을 극대화하기 위해 Mixture of Experts(MoE) 구조를 도입한 'Kanana-1.5-15.7B-A3B' 모델을 개발하고 Kakao Hugging Face에 오픈소스로 공개했다. 이 모델은 기존 Dense 모델(Kanana-Nano-1.5-3B)의 MLP 레이어를 복제·분할하여 64개의 초소형 Expert를 구성하고, 입력마다 8개의 Expert만 활성화하는 Fine-grained 구조를 채택했다. 학습은 Dense 모델 Upcycling 후 2단계 Pre-training(1단계: 고품질 일반 데이터 700B 토큰, 2단계: 도메인 특화 데이터 300B 토큰)을 거쳤다. 벤치마크 결과, 활성 파라미터 3B(전체 15.7B의 약 37%)만으로 Dense 8B 모델과 대등하거나 일부 항목에서 더 나은 성능을 기록했으며, Post-training 단계에서는 Staged RL과 On-policy Distillation을 적용해 성능을 더욱 끌어올렸다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.