Apple, 자가 피드백 내재화로 어려운 과제 성능 높이는 RLTL;DR 공개
핵심 내용
Apple 연구진이 자가 피드백 내재화로 어려운 과제에서 성능을 높이는 RLTL;DR을 공개했다.
자세히 보기
Apple 연구진이 정답 확률이 낮거나 교사가 없는 상황에서 에이전트가 스스로 개선하도록 돕는 강화 학습 기법 RLTL;DR을 공개했다. 기존 **Reinforcement Learning with Verifiable Rewards (RLVR)**는 에이전트가 단 한 번도 정답을 내지 못한 어려운 과제에서는 최적화할 궤적이 없어 성능 향상에 한계가 있었다.
RLTL;DR 작동 원리
RLTL;DR은 성공적인 시도 대신 자가 생성 피드백에 의존한다. 실패할 때마다 에이전트는 검증기 출력 기반으로 간결한 TL;DR 인사이트를 작성한다. 이후 롤아웃은 이전 인사이트들을 모두 조건으로 삼으며, 모델은 이 인사이트들을 역전파해 과제 → 인사이트 매핑을 내재화한다.
성능 결과
Pass@128 = 0으로 필터링된 어려운 도구 호출 및 코딩 데이터셋에서 Qwen 3.5 9B Thinking 정책의 표준 GRPO 학습은 0%에서 1% Pass@1 수준에 머물렀다. RLTL;DR은 이 한계를 돌파하며 다음 성과를 거뒀다:
- 학습 중 인사이트가 컨텍스트에 포함될 때 14–31% Pass@1
- 평가 시 인사이트가 컨텍스트에 없을 때 12–13% Pass@1
SFTL;DR 변형
연구진은 핵심 메커니즘이 과제-인사이트 매핑의 내재화임을 확인했다. 롤아웃을 보여주거나 역전파하지 않고 (과제, 인사이트) 튜플만으로 학습하는 단순화된 변형 SFTL;DR을 테스트했다. 이 튜플 4k개만으로 학습해도 RLTL;DR의 성능을 거의 회복했으며, 이는 특정 과제 유형에 대해 "이런 점을 염두에 두는" 압축된 학습 패러다임의 가능성을 시사한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.