LLM 강화학습 효율 높이는 PipelineRL
PipelineRL
·2025.04.26 07:37
LLM 강화학습 시 추론 처리량과 데이터 품질 사이의 트레이드오프를 해결하는 PipelineRL이 공개되었다.
PipelineRL은 LLM의 대규모 강화학습(RL) 과정에서 발생하는 **추론 처리량(Inference Throughput)**과 온폴리시(On-policy) 데이터 수집 간의 상충 관계를 해결하기 위한 실험적 구현체다.
핵심 혁신은 인플라이트 가중치 업데이트(Inflight weight updates) 기술이다. 기존 방식은 높은 처리량을 위해 큰 배치 사이즈를 사용하면 정책 업데이트와 데이터 수집 사이의 시차(Lag)가 발생해 데이터가 오프폴리시(Off-policy)화되는 문제가 있었다. PipelineRL은 추론 서버를 중단하지 않고 각 옵티마이저 단계 직후 가중치를 업데이트함으로써, 추론 서버가 최적의 배치 사이즈를 유지하면서도 데이터가 온폴리시 상태를 유지하도록 돕는다.
주요 성과 및 특징은 다음과 같다:
- 우수한 성능: 7B 및 32B 모델을 학습한 결과, AIME 2024 및 MATH 500 벤치마크에서 Open-Reasoner-Zero와 대등하거나 더 높은 성능을 보였다.
- 알고리즘 단순화: 복잡한 가치 함수(Value function) 없이 GRPO의 단순화 버전을 사용하여 학습 안정성을 확보했다.
- 모듈형 아키텍처: 다양한 추론 및 트레이너 조합을 쉽게 테스트할 수 있는 구조를 갖추고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.