AI Briefing

카카오, 3T 토큰 학습한 Kanana Essence로 llama-3.1-8b 벤치마크 평균 능가

·2024.11.14 00:00

핵심 내용

카카오가 3T 토큰으로 학습한 Kanana Essence가 llama-3.1-8b 대비 벤치마크 평균에서 더 높은 성능을 기록했으며, Kanana Nano는 프루닝 및 증류 기법으로 효율성을 극대화했다.

1 / 8

자세히 보기

카카오는 기존 LLM의 Scaling law 한계를 극복하기 위해 Two-staged pre-training 전략을 채택했습니다. 이 전략을 통해 Kanana Essence는 총 3T 토큰(Stage 1: 2.7T, Stage 2: 0.3T)으로 학습되었으며, llama-3.1-8b가 학습한 토큰 수 대비 훨씬 적은 양으로 벤치마크 평균 점수 57.52점을 달성하여 llama-3.1-8b(50.54점)를 상회했습니다. 특히 한국어 벤치마크(KMMLU, HAE-RAE)에서 두드러진 성능 향상을 보였습니다. 다만 영어 벤치마크(MMLU) 점수는 llama-3.1-8b보다 다소 낮게 나타났습니다. 초경량 모델인 Kanana Nano는 From Scratch 학습 대신 Pruning & Distillation 기법을 적용하여, From Scratch 대비 1/10의 데이터만으로 더 우수한 성능(평균 52.07점)을 확보했습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.