AI Briefing

RL 학습 속도 최대 7.5배 향상

prompt caching, but for rl training - 7.5x speedup on long-prompt/short-response workloads

·2026.05.12 06:01

RL 학습 시 긴 프롬프트를 한 번만 계산하는 캐싱 기법을 통해 학습 효율을 대폭 개선했다.

기존 오픈소스 RL 엔진은 그룹 내 모든 샘플에 대해 '프롬프트 + 응답' 시퀀스를 매번 반복 처리하므로, 프롬프트가 길고 응답이 짧은 경우 연산 낭비가 심하다.

이를 해결하기 위해 프롬프트를 한 번만 계산한 뒤 여러 응답을 처리하는 프롬프트 캐싱(Prompt Caching) 방식을 RL 학습에 적용했다. 학습 시 그래디언트가 프롬프트로 전달되어야 하는 특성을 고려하여, 인과적 어텐션(causal attention) 구조를 유지하는 기술적 최적화를 거쳤다.

Qwen3.5-4B 모델 기준 테스트 결과는 다음과 같다:

  • 16k 프롬프트 / 64 응답: 7.5배 향상
  • 16k 프롬프트 / 128 응답: 7.3배 향상
  • 16k 프롬프트 / 1k 응답: 5.4배 향상
  • 8k 프롬프트 / 4k 응답: 1.7배 향상

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.