AI Briefing

카카오, Kanana-2 공개… 병렬 RL과 미드트레이닝으로 에이전트 성능 강화

·2026.01.15 00:00

핵심 내용

미드트레이닝과 병렬 RL 파이프라인을 적용해 한국어 성능 저하 없이 Agentic 능력을 강화했다.

1 / 6

자세히 보기

카카오 카나나 LLM 조직이 Kanana-2 모델 4종(Base, Mid-training, Instruct, Thinking)을 공개했다. 이번 업데이트는 Agentic AI 최적화를 목표로 Tool Calling과 Instruction Following 능력을 강화하는 데 초점을 맞췄다.

Mid-training을 통한 추론 기반 강화

Pre-training과 Post-training 사이에 Mid-training 단계를 도입해 복잡한 추론 및 Agentic 능력 습득의 기반을 마련했다. 총 250B 토큰 규모(영어 추론 200B + 한국어 리플레이 50B)로 학습하여 영어 데이터만 사용 시 발생하는 한국어 벤치마크 성능 저하(Catastrophic Forgetting)를 방지했다. 그 결과 Kanana-2-30B-A3B는 Base 모델 대비 HumanEval 75.29, GSM8K 82.71, MATH 54.40으로 수학 및 코딩 성능이 향상되었으며, 일반 언어 능력도 유지했다.

병렬 RL과 Merging으로 성능 극대화

기존 순차적 RL의 한계를 극복하기 위해 Parallel RL Pipeline을 도입했다. Instruction Following, Tool Calling, Math, Coding을 독립적인 파이프라인으로 분리 학습한 후 Linear Merging과 Calibration Tuning을 수행했다. 이를 통해 각 태스크의 성능 하락을 보완하고 통합 모델의 성능을 복원했다.

  • Instruct 모델: IFEval 87.25, IFBench 48.30, BFCL-v3 multi-turn-base 52.00을 기록하며 Qwen3 대비 Instruction Following과 Tool Calling에서 우위를 점했다.
  • Thinking 모델: 한국어 답변을 위해 '영어 사고 과정 -> 한국어 답변' 구조를 채택했다. 병렬 RL 적용으로 수학 능력 저하 없이 IF 및 Tool 성능을 극대화했으며, AIME25 점수는 Calibration 후 74.00으로 상승했다.

향후 계획

카카오는 병렬 RL의 적용 범위를 고차원 텍스트 추론, STEM, 복잡한 Agentic Workflow로 확장하고, RL 학습 비용 급증을 완화하기 위한 비동기 알고리즘 도입 등을 지속적으로 탐색할 계획이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.