AI Briefing

3대 맥미니 GRPO

Training Qwen2.5-0.5B-Instruct on Reddit posts summarization tasks with length constraint on my 3xMac Minis with GRPO - evals update

·2026.04.16 19:22

핵심 내용

3대 Mac mini로 Qwen2.5-0.5B-Instruct를 GRPO로 학습해 요약 품질을 비교했다.

자세히 보기

Qwen2.5-0.5B-Instruct를 Reddit 게시글 요약 태스크에 맞춰 GRPO로 학습했고, 3대의 Mac mini에서 실험을 돌렸다.

학습 방식은 두 가지였다.

  • length penalty만 사용
  • quality reward + length penalty를 함께 사용

평가는 DeepEval 기반의 LLM-as-a-Judge로 진행했다. 점수 항목은 다음 4가지였다.

  • Faithfulness: 원문에 충실한가
  • Coverage: 핵심 내용을 빠뜨리지 않는가
  • Conciseness: 불필요하게 길지 않은가
  • Clarity: 읽기 쉽고 명확한가

결과는 quality reward를 추가한 모델이 2.5/4, length penalty만 쓴 모델이 2.4/5였다.

또한 smoltldr 데이터셋의 테스트 샘플 200개로 평가했고, 5라운드의 평가 결과를 바탕으로 한 one-sided t-test에서 ROUGE-L 기반 quality reward가 최종 composite score에 대해 p-value 0.0042로 유의미했다.

보상 설계는 다음처럼 정리된다.

  • length_penalty: -abs(response_length - MAX_LENGTH)
  • quality_reward: 정답 요약과의 ROUGE-L

즉, 단순 길이 제어보다 품질 보상 + 길이 패널티 조합이 소형 모델의 요약 품질을 더 끌어올렸다는 업데이트다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.