카카오, 멀티모달 언어모델 Kanana-v 공개… 한국어 OCR 성능 GPT-4o 능가
핵심 내용
한국어 벤치마크 평균 75.1점으로 GPT-4o(61.9점)를 상회하며, Native resolution과 C-Abstractor 구조를 채택했다.
자세히 보기
카카오의 Kanana ⍺ 조직이 자체 개발한 멀티모달 언어모델 Kanana-v의 성능과 개발 과정을 공개했다. 이 모델은 CVPR 2024 하이라이트 논문인 Honeybee의 연구 성과를 기반으로 하며, 현재 프리뷰 단계임에도 불구하고 한국어와 영어 모두에서 경쟁력 있는 성능을 입증했다.
한국어 성능: 압도적 우위
한국어 특화 벤치마크(OCR, 문서 이해, 문제 풀이, 한국형 지식) 평가에서 Kanana-v는 평균 75.1점을 기록해 GPT-4o(61.9점)와 GPT-4V(39.8점)를 크게 앞섰다. 특히 한국어 OCR 영역에서는 84.4점으로 GPT-4o(49.0점) 대비 압도적인 읽기 능력을 보였다. 한국형 지식 영역에서는 상용 모델 중 두 번째로 높은 점수를 기록해 추가 데이터 확보를 통한 개선이 필요한 것으로 나타났다.
영어 성능: 글로벌 경쟁력 확보
영어 벤치마크 평균 점수는 75.9점으로 GPT-4o(76.8점)와 유사한 수준이며, Qwen2-VL(75.8점)을 소폭 상회했다. DocVQA에서는 94.5점으로 GPT-4o(92.8점)보다 높은 점수를 기록했으며, OCRBench에서도 81.8점으로 GPT-4o(73.6점)를 능가했다.
기술적 특징 및 학습 전략
Kanana-v는 고해상도 이미지 처리를 위해 이미지를 조각내지 않고 원본 해상도를 유지하는 Native resolution 방식을 채택했다. 이는 전체 맥락을 보존하는 원칙적 접근으로, 사전 학습된 비전 인코더의 확장 작업이 필요하다. 비전 인코더와 언어모델 연결에는 공간 정보를 보존하면서 토큰 수를 유동적으로 조절하는 C-Abstractor 프로젝터를 사용했다.
학습은 4단계로 진행되었다:
- Projector pre-training: 이미지 캡션 데이터로 프로젝터 사전학습
- Continued pre-training: 고품질 캡션, OCR, 문서 데이터로 전체 모델 학습
- Supervised fine-tuning: VQA 포맷 데이터로 질문-답변 능력 학습
- Human preference alignment: RLHF 기법으로 사용자 선호 및 안전성 정렬
또한, 망각 현상(Catastrophic forgetting) 방지를 위해 언어 벤치마크를 추적하며 학습률을 조정했고, Chain-of-Thought(CoT) 방식의 추론 근거를 포함한 고품질 데이터를 구축해 논리적 설명 능력을 강화했다.
향후 계획
카카오는 Kanana-v의 멀티턴 대화 능력 강화와 온디바이스 서빙을 위한 모델 경량화를 추진 중이다. 인물 식별 정확도 개선을 위해 한국 인물 데이터를 보강하고 있으며, 오디오와 비디오 입력을 지원하는 통합 멀티모달 모델 Kanana-o 개발도 병행하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.