카카오, 모델 병합으로 음성·시각 통합한 멀티모달 LLM 'Kanana-o' 공개
·2025.05.01 00:00
핵심 내용
카카오가 음성 모델(Kanana-a)과 시각 모델(Kanana-v)을 모델 병합 기법으로 통합한 멀티모달 LLM 'Kanana-o'를 공개했으며, 한국어 음성 인식(CER 8.5) 등에서 글로벌 모델 대비 우수한 성능을 입증했다.
1 / 9
자세히 보기
카카오 Kanana 조직은 텍스트, 이미지, 오디오를 모두 이해하고 생성할 수 있는 통합 멀티모달 언어모델 'Kanana-o'를 공개했다. 이 모델은 기존에 개발된 음성 특화 모델(Kanana-a)과 시각 특화 모델(Kanana-v)이 동일한 LLM 백본을 공유한다는 점에 착안해, 두 모델을 모델 병합(Model Merging) 기법으로 결합하고 짧은 추가 학습을 거쳐 완성되었다. 이를 통해 전체를 처음부터 학습하는 방식과 동등한 성능을 달성하면서도 개발 시간과 유연성을 확보했다. 성능 평가 결과, 한국어 음성 인식(CER)에서 8.5점을 기록해 GPT-4o(17.5점) 등 글로벌 모델들을 압도했으며, 감정 인식 및 이미지-오디오 통합 이해 벤치마크에서도 경쟁력 있는 성과를 보였다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.