AI Briefing

VibeThinker: 새로운 SFT+GRPO 방식을 통해 추론 능력에서 Opus 4.5를 능가하는 3B 파라미터 모델

·2026.06.23 11:01

SFT와 GRPO를 결합해 3B 규모로도 높은 추론 성능을 구현한 VibeThinker 모델이 공개되었습니다.

새로운 학습 방식인 **SFT(Supervised Fine-Tuning)**와 **GRPO(Group Relative Policy Optimization)**를 결합하여, 파라미터 수가 3B에 불과함에도 불구하고 Opus 4.5와 같은 대형 모델을 능가하는 추론 성능을 보여주는 VibeThinker 모델이 발표되었습니다.

이 모델은 방대한 지식을 암기하는 대신 **추론 능력(Reasoning)**을 극대화하는 데 집중하며, 특정 도메인(예: Python 프로그래밍)에서 매우 효율적인 성능을 발휘합니다. 이는 모델의 크기를 줄이면서도 핵심적인 사고 능력을 보존하는 Parametric Compression-Coverage Hypothesis를 뒷받침하는 연구 결과를 담고 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.