AI Briefing

QwQ-32B: 강화 학습의 힘을 활용하다

·2025.03.06 01:00

Qwen이 강화 학습을 통해 DeepSeek-R1에 필적하는 추론 성능을 구현한 **QwQ-32B** 모델을 공개했다.

강화 학습(RL) 스케일링은 기존의 사전 학습 및 사후 학습 방식을 넘어 모델의 추론 능력을 비약적으로 향상시킬 수 있는 핵심 기술이다.

QwQ-32B는 320억 개의 파라미터를 가진 모델로, 6,710억 개의 파라미터를 보유한 DeepSeek-R1에 필적하는 성능을 구현했다. 이는 방대한 지식을 학습한 견고한 파운데이션 모델에 RL을 적용했을 때의 강력한 효과를 입증한다. 또한, 에이전트 기능을 통합하여 도구 활용 및 환경 피드백에 따른 비판적 추론이 가능하다.

모델 학습은 두 단계의 RL 스케일링 과정을 거친다:

  • 1단계 (수학 및 코딩): 결과 기반 보상(Outcome-based rewards)을 활용한다. 수학 문제는 정확도 검증기를, 코딩은 코드 실행 서버를 통해 정답 여부를 판별하며 성능을 최적화한다.
  • 2단계 (일반 능력): 일반 보상 모델과 규칙 기반 검증기를 사용하여 지시 이행, 인간 선호도 정렬, 에이전트 성능 등 전반적인 능력을 강화한다.

QwQ-32B는 Apache 2.0 라이선스에 따라 오픈 웨이트로 공개되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.