카카오, Kanana-1.5 추론 성능 강화 연구 공개… SFT와 RL 최적화 전략 제시
핵심 내용
SFT 단계의 높은 학습률과 RL에서의 Clipping 완화 전략으로 AIME 벤치마크 성능을 개선했다.
자세히 보기
카카오가 Kanana-1.5 모델에 추론 기능을 적용하기 위한 연구 과정을 공개했습니다. 기존 LLM 추론 기술의 핵심인 **Supervised Fine-Tuning(SFT)**과 Reinforcement Learning(RL) 단계에서의 구체적인 최적화 전략과 실험 결과를 공유하며, 특히 SFT 단계의 중요성을 강조했습니다.
SFT 단계의 핵심: 데이터 선별과 학습률
연구팀은 추론 능력을 내재화하기 위해 Two-staged SFT 전략을 도입했습니다. 이는 verify_score(정확도)와 CV(변동계수, 난이도 및 학습 잠재력 지표)를 활용해 데이터를 선별하는 방식입니다.
- Stage I: 적절한 난이도의 데이터를 선별해 기본 추론 패턴을 학습시킵니다.
- Stage II: CV가 높은 고난이도 데이터에 집중하여 추론 성능을 극대화합니다.
또한, 학습률(LR)이 성능 상한을 결정짓는 핵심 요인임을 확인했습니다. Stage I과 II 모두에서 충분히 큰 LR을 사용했을 때 AIME 2024 평가에서 가장 높은 성능을 기록했으며, 지나치게 작은 LR은 성능 저하를 유발했습니다.
RL 단계의 최적화: GRPO와 PPO 비교
강화학습 단계에서는 DeepMath-103K 데이터셋을 기반으로 난이도 필터링과 중복 제거를 거쳐 DeepMath-62K를 구성했습니다. 객관식이나 Yes/No 질문처럼 추론 과정 없이 정답을 맞힐 수 있는 문제는 제외했습니다.
- Clipping 전략: GRPO 알고리즘에서 하한값($\epsilon_{low}$)을 완화(0.99)하고 상한값($\epsilon_{high}$)을 적절히 설정하는 것이 낮은 확률 토큰 학습에 효과적임을 확인했습니다.
- PPO vs GRPO: 동일한 조건에서 비교 실험한 결과, 후반 학습 구간에서 Value Function을 명시적으로 근사하는 PPO가 GRPO보다 더 안정적이고 높은 Reward를 달성했습니다.
이종 도메인 학습과 일반화
코드 데이터셋만으로 강화학습을 수행했음에도 수학 벤치마크 성능이 향상되는 현상을 관찰했습니다. 이는 Staged RL 전략을 통해 확인되었으며, 코드 학습이 수학 문제 해결에 필요한 추론 능력을 함께 습득하게 함을 시사합니다. 수학만 학습한 모델 대비 코드-수학 순서로 학습한 모델이 AIME 2025에서 약 4점 높은 점수를 기록했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.