Liger Kernel, GRPO 메모리 40% 절감
🐯 Liger GRPO meets TRL
·2025.05.25 09:00
Liger Kernel이 TRL에 통합되어 GRPO 학습 시 메모리 사용량을 40% 절감한다.
Liger Kernel이 Hugging Face의 TRL 라이브러리에 통합되어 GRPO(Group Relative Policy Optimization) 학습 효율을 대폭 개선했다.
Liger Chunked Loss 방식을 적용하여, 학습 과정에서 모든 로짓(logits)을 메모리에 저장하는 대신 청크(chunk) 단위로 계산하고 그래디언트를 누적한다. 이를 통해 모델 품질 저하 없이 피크 메모리 사용량을 40% 감소시켰다.
또한 FSDP(Fully Sharded Data Parallel) 및 PEFT(Parameter-Efficient Fine-Tuning) 지원이 추가되어, 여러 GPU와 노드에 걸친 대규모 GRPO 스케일링이 더욱 용이해졌다.
사용자는 GRPOConfig에서 use_liger_loss=True 설정을 통해 이 기능을 즉시 활성화할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.