AI Briefing

카카오, 자체 LLM '카나나' 테크니컬 리포트 공개 및 Nano 2.1B 오픈소스 배포

·2025.02.27 00:00

핵심 내용

Kanana Flag는 타사 대비 학습 비용 50% 이상 절감하며 한국어 벤치마크에서 압도적 성능을 입증했다.

1 / 3

자세히 보기

카카오가 자체 개발한 AI 모델 패밀리 **'카나나(Kanana)'**의 전체 구조와 학습 과정, 성능을 담은 테크니컬 리포트를 공개했습니다. 이번 발표는 Kanana Flag, Essence, Nano로 구성된 언어모델 라인업의 완성도를 입증하고, 연구 생태계 기여를 위해 Kanana Nano 2.1B를 오픈소스로 배포하는 내용을 포함합니다.

글로벌 경쟁력 확보와 학습 효율화

카카오는 한정된 자원 내에서 SOTA(State-of-the-Art) 수준의 성능을 달성하기 위해 다양한 학습 기법을 적용했습니다. 그 결과 최상위 모델인 Kanana Flag 32.5B는 타사 모델 대비 50% 이상의 학습 비용을 절감하면서도 높은 성능을 기록했습니다. 특히 영어 벤치마크(MMLU, MT-Bench)에서는 글로벌 모델과 유사한 성능을 보였으며, 한국어 벤치마크(KMMLU, KoMT-Bench)에서는 경쟁 모델 대비 압도적인 처리 성능을 입증했습니다.

Staged Pre-training과 모델 확장 전략

카카오는 Staged pre-training 방식을 통해 학습 효율을 극대화했습니다. 먼저 8B와 26.8B 크기의 모델을 학습한 후, 이를 기반으로 다음과 같은 방식으로 모델 라인업을 확장했습니다.

  • 경량화: 8B 모델에 가지치기(Pruning)와 지식증류(Distillation)를 적용해 Kanana Nano 2.1B를 구축했습니다.
  • 확장: 8B와 26.8B 모델에 깊이 업스케일링(DUS) 기법을 적용해 Kanana Essence 9.8B와 Kanana Flag 32.5B를 개발했습니다.

이러한 전략으로 유사 사이즈의 글로벌 모델 대비 절반 이하의 학습 비용으로 고성능 모델을 확보할 수 있었습니다.

온디바이스 활용 가능한 Nano 2.1B 오픈소스 공개

연구자와 개발자의 활용도를 높이기 위해 Kanana Nano 2.1B의 base, instruct, embedding 세 가지 버전을 오픈소스로 공개했습니다. 이 모델은 온디바이스 환경에서도 원활히 운영될 수 있도록 설계되었으며, 복잡한 추론이나 고난도 수학 문제에서는 한계가 있을 수 있으나 다양한 응용 분야에서 활용도가 높을 것으로 기대됩니다. 향후 카카오는 강화학습(RL)과 연속 학습(Continual learning)을 접목해 추론 능력과 멀티모달 기능을 고도화할 계획입니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.