다루기 쉬운 궤적 제어를 통한 구조적 추론 학습
핵심 내용
Apple 연구진이 LLM이 복잡한 문제 해결에 필요한 다양한 추론 패턴을 효과적으로 학습하도록 돕는 Ctrl-R 프레임워크를 제안했다.
자세히 보기
LLM은 'wait'와 같은 특정 어휘 패턴을 통해 스스로 검증하는 등 창발적 추론 능력을 보이기도 하지만, 무작위 샘플링 환경에서 복잡한 추론 궤적을 발견하기는 매우 어렵습니다. 기존의 강화학습(RL) 방식은 다양한 추론 행동을 확보하는 데 한계가 있습니다.
이를 해결하기 위해 제안된 Ctrl-R은 Tractable Trajectory Control(다루기 쉬운 궤적 제어) 프레임워크를 통해 추론 과정을 능동적으로 가이드합니다. 이 방식은 복잡한 문제 해결에 필수적인 다양한 추론 패턴을 탐색하도록 유도하며, 정확한 Importance-sampling 추정을 지원하여 편향 없는 온폴리시(On-policy) 최적화를 가능하게 합니다.
또한, Power-scaling factor를 중요도 샘플링 가중치에 도입하여, 최적화의 안정성을 유지하면서도 분포 외(Out-of-distribution)의 탐색적 궤적으로부터 모델이 선택적으로 학습할 수 있도록 설계되었습니다.
실험 결과, Ctrl-R은 기존 모델이 도달하기 어려웠던 추론 패턴을 효과적으로 내재화했으며, 수학적 추론 작업에서 언어 및 시각-언어 모델(Vision-Language Models) 모두에게 일관된 성능 향상을 입증했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.