3대 맥미니 GRPO
Training Qwen2.5-0.5B-Instruct on Reddit posts summarization tasks with length constraint on my 3xMac Minis with GRPO - evals update
·2026.04.16 19:22
핵심 내용
3대 Mac mini로 Qwen2.5-0.5B-Instruct를 GRPO로 학습해 요약 품질을 비교했다.
자세히 보기
Qwen2.5-0.5B-Instruct를 Reddit 게시글 요약 태스크에 맞춰 GRPO로 학습했고, 3대의 Mac mini에서 실험을 돌렸다.
학습 방식은 두 가지였다.
- length penalty만 사용
- quality reward + length penalty를 함께 사용
평가는 DeepEval 기반의 LLM-as-a-Judge로 진행했다. 점수 항목은 다음 4가지였다.
- Faithfulness: 원문에 충실한가
- Coverage: 핵심 내용을 빠뜨리지 않는가
- Conciseness: 불필요하게 길지 않은가
- Clarity: 읽기 쉽고 명확한가
결과는 quality reward를 추가한 모델이 2.5/4, length penalty만 쓴 모델이 2.4/5였다.
또한 smoltldr 데이터셋의 테스트 샘플 200개로 평가했고, 5라운드의 평가 결과를 바탕으로 한 one-sided t-test에서 ROUGE-L 기반 quality reward가 최종 composite score에 대해 p-value 0.0042로 유의미했다.
보상 설계는 다음처럼 정리된다.
- length_penalty:
-abs(response_length - MAX_LENGTH) - quality_reward: 정답 요약과의 ROUGE-L
즉, 단순 길이 제어보다 품질 보상 + 길이 패널티 조합이 소형 모델의 요약 품질을 더 끌어올렸다는 업데이트다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.