카카오, Kanana-o 성능 고도화… 멀티모달 지시 이행 및 감정 표현력 강화
핵심 내용
DPO 학습과 배우 녹음 데이터로 감정 표현력 향상, 한국어 이미지 기반 벤치마크에서 GPT-4o 추월
자세히 보기
카카오 Kanana 조직이 멀티모달 AI 모델 Kanana-o의 진화 과정을 공개했다. 이번 업데이트는 벤치마크 점수 향상보다 실제 서비스 환경에서 사람처럼 자연스럽게 상호작용하는 AI 구현에 초점을 맞췄다. 기존 음성 인식(ASR) 및 음성 합성(TTS) 성능을 유지하면서 Multimodal Instruction Following 능력과 발화 표현력을 대폭 강화했다.
멀티모달 지시 이행 능력 고도화 텍스트, 이미지, 음성 등 다양한 모달리티를 고려해 복잡한 지시를 정확히 해석하는 능력을 키웠다. 요약, 번역, 추론 등 다단계 지시와 이미지-오디오 상호 참조 데이터를 포함한 고품질 데이터셋을 직접 구축했다. 그 결과 MIABench-Ko(한국어 이미지 기반)에서 91.22점을 기록하며 GPT-4o(89.51점)를 앞질렀다. 다만 Speech AlpacaEval 등 일부 글로벌 벤치마크에서는 GPT-4o와 Gemini-2.5-Pro보다 낮은 점수를 보였다.
감정 표현력 및 자연스러운 대화 강화 정보 전달을 넘어 감정과 뉘앙스가 담긴 음성 생성을 위해 DPO(Direct Preference Optimization) 학습과 실제 배우 녹음 데이터를 활용했다. 슬픔, 행복 등 감정 스타일과 음색 표현에서 평균 점수가 3.24에서 3.54로 상승했다. 또한 팟캐스트 스타일의 다화자 대화와 사투리, 맥락 전환 등 비정형 요청에 대응하는 멀티턴 대화 시나리오를 확장해 대화의 생동감을 높였다.
향후 로드맵 카카오는 향후 Full-duplex(동시) 음성 대화 지원과 On-device(온디바이스) 모델 경량화를 추진한다. 말 겹침을 허용하고 즉각 반응하는 구조로 고도화하며, 스마트폰 및 웨어러블 단말에서 실행 가능한 하이브리드 구조를 탐색한다. 또한 음악, 환경음, Foley 사운드까지 생성하는 범용 오디오 모델로 확장하고 인간 선호도 정렬(RLHF)을 통해 안전성을 강화할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.