AI Briefing

영어를 넘어선 GRPO: 비영어 및 다국어 환경에서의 GRPO 대규모 연구

·2026.08.18 09:00

핵심 내용

GRPO를 활용한 비영어 및 다국어 환경에서의 추론 성능과 언어 간 전이 효과를 대규모로 분석했다.

자세히 보기

Reinforcement Learning with Verifiable Rewards (RLVR), 특히 **GRPO(Group Relative Policy Optimization)**는 언어 모델의 추론 능력을 높이는 핵심 기술이지만, 지금까지의 연구는 영어에 지나치게 편중되어 있었다.

다양한 베이스 모델과 학습 언어, 추론 언어 보상을 활용하여 비영어 및 다국어 환경에서의 GRPO를 대규모로 실증 분석한 결과, 다음과 같은 핵심 사실이 확인되었다.

  • 모국어 추론 성능: 특정 언어로 추론을 학습할 경우, 영어로 학습했을 때와 비교해 성능 격차가 매우 적게 나타난다.
  • 교차 언어 전이: 한 언어에서의 학습이 다른 여러 언어의 성능을 향상시키는 강력한 전이 효과를 보였다.
  • 언어별 성능 저하 위험: 특정 언어 학습이 다른 언어의 도메인 외(out-of-domain) 능력을 심각하게 저하시키는 사례도 존재하며, 이는 모델과 언어에 따라 매우 상이하게 나타난다.

RLVR을 영어 이외의 언어로 확장할 때는 광범위한 성능 향상을 기대할 수 있으나, 언어별 성능 퇴보를 감지하기 위한 포괄적인 평가가 반드시 수반되어야 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.