AI Briefing

Apple, 자가 피드백 내재화로 어려운 과제 성능 높이는 RLTL;DR 공개

·2026.10.01 09:00

핵심 내용

Apple 연구진이 자가 피드백 내재화로 어려운 과제에서 성능을 높이는 RLTL;DR을 공개했다.

자세히 보기

Apple 연구진이 정답 확률이 낮거나 교사가 없는 상황에서 에이전트가 스스로 개선하도록 돕는 강화 학습 기법 RLTL;DR을 공개했다. 기존 **Reinforcement Learning with Verifiable Rewards (RLVR)**는 에이전트가 단 한 번도 정답을 내지 못한 어려운 과제에서는 최적화할 궤적이 없어 성능 향상에 한계가 있었다.

RLTL;DR 작동 원리

RLTL;DR은 성공적인 시도 대신 자가 생성 피드백에 의존한다. 실패할 때마다 에이전트는 검증기 출력 기반으로 간결한 TL;DR 인사이트를 작성한다. 이후 롤아웃은 이전 인사이트들을 모두 조건으로 삼으며, 모델은 이 인사이트들을 역전파해 과제 → 인사이트 매핑을 내재화한다.

성능 결과

Pass@128 = 0으로 필터링된 어려운 도구 호출 및 코딩 데이터셋에서 Qwen 3.5 9B Thinking 정책의 표준 GRPO 학습은 0%에서 1% Pass@1 수준에 머물렀다. RLTL;DR은 이 한계를 돌파하며 다음 성과를 거뒀다:

  • 학습 중 인사이트가 컨텍스트에 포함될 때 14–31% Pass@1
  • 평가 시 인사이트가 컨텍스트에 없을 때 12–13% Pass@1

SFTL;DR 변형

연구진은 핵심 메커니즘이 과제-인사이트 매핑의 내재화임을 확인했다. 롤아웃을 보여주거나 역전파하지 않고 (과제, 인사이트) 튜플만으로 학습하는 단순화된 변형 SFTL;DR을 테스트했다. 이 튜플 4k개만으로 학습해도 RLTL;DR의 성능을 거의 회복했으며, 이는 특정 과제 유형에 대해 "이런 점을 염두에 두는" 압축된 학습 패러다임의 가능성을 시사한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.