Mac Mini 3대로 GRPO 실험
Training LFM-2.5-350M on Reddit post summarization with GRPO on my 3x Mac Minis — final evals and t-test evals are here
·2026.04.26 19:28
3x Mac Mini 클러스터에서 GRPO로 Reddit 요약 모델을 학습해 품질+길이 보상이 최상 성능을 냈다.
LFM-2.5-350M을 대상으로 Reddit पोस्ट 요약을 학습했고, 목표는 64토큰 내 길이 제한 요약을 소형 LLM으로 만들 수 있는지 검증하는 것이었다.
학습은 3대 Mac Mini 클러스터에서 진행했다. 1대는 학습을 담당하고, 2대는 vLLM-metal로 rollout을 수행했으며, smolcluster의 SyncPS 구조를 사용했다.
보상 설계는 두 가지를 비교했다.
- length-only: 길이 패널티만 사용
- length-quality: ROUGE-L + METEOR 같은 품질 보상과 길이 패널티를 결합
평가는 DeepEval 기반 LLM-as-a-Judge(gpt-5) 파이프라인으로 진행했다. 축은 Faithfulness, Coverage, Conciseness, Clarity였고, smoltldr 데이터셋 테스트 샘플 200개에서 측정했다.
결과는 품질 보상을 넣은 설정이 우세했다.
- 최고 구성: length-quality-meteor-rouge
- Composite 2.769
- Faithfulness 0.832, Coverage 0.511, Conciseness 0.659, Clarity 0.767
- Pass Rate 44.3%
반면 length-only baseline은 Composite 2.416으로 낮았고, 전반적으로 품질·정확도 지표가 떨어졌다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.