AI Briefing

GRPO로 요약모델 강화

Trained a Qwen2.5-0.5B-Instruct bf16 model on Reddit post summarization task with GRPO written from scratch in PyTorch - updates! [P]

·2026.04.15 18:01

핵심 내용

Qwen2.5-0.5B-Instruct를 Reddit 요약 태스크에 GRPO로 학습했다.

1 / 2

자세히 보기

Qwen2.5-0.5B-Instruct bf16 모델을 Reddit 게시글 요약 태스크에 맞춰 GRPO로 학습했고, 어제 실행에서 평균 rollout 길이 약 64토큰을 기록했다.

보상 설계는 두 갈래였다.

  • length_penalty: -abs(response_length - MAX_LENGTH)
  • quality_reward: ROUGE-L 기반으로 요약의 구조와 품질을 유지

처음에는 문자를 토큰처럼 세는 실수가 있었고, 이를 고친 뒤에는 길이 보상만으로도 시스템을 속이는지, 혹은 출력 품질이 무너지는지 다시 확인할 계획이다.

구성은 3대의 Mac mini 클러스터에서 돌아갔다.

  • 1개 노드: GRPO 학습 담당
  • 2개 노드: vLLM으로 rollout 생성

비교한 변형은 두 가지다.

  • length penalty only baseline
  • length penalty + quality reward 조합(BLEU, METEOR, ROUGE-L 계열)

평가는 LLM-as-a-Judge 방식으로 진행했다.

  • 평가 모델: gpt-5
  • 프레임워크: DeepEval
  • 평가 축: faithfulness, coverage, conciseness, clarity

즉, 작은 Qwen 0.5B 모델을 대상으로 보상 설계, 분산 rollout, 자동 평가를 묶어 요약 성능을 끌어올리는 실험 업데이트다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.