FTPO를 활용한 LLM 반복 생성 문제 해결
Reducing Doom Loops with Final Token Preference Optimization
·2026.07.08 06:58
핵심 내용
LLM의 반복적 생성 오류인 'Doom Loop'를 해결하기 위한 새로운 최적화 방법론을 제안한다.
자세히 보기
모델이 특정 문구(예: "Wait, let me reconsider...")를 무한히 반복하며 컨텍스트를 소진하는 'Doom Loop' 현상은 특히 추론 능력을 갖춘 소형 모델에서 빈번하게 발생합니다.
기존의 해결책과 한계는 다음과 같습니다.
- Repetition Penalty: 추론 시 출력 분포를 재조정하지만, 성능 저하를 유발할 수 있는 임시방편적 해결책임.
- Reinforcement Learning: 반복 문제를 타겟팅할 수 있으나, 정교한 보상 설계와 비용이 많이 드는 온라인 롤아웃(Online Rollouts)이 필요함.
본 논문은 이러한 문제를 해결하기 위해 Final Token Preference Optimization(FTPO) 방식을 제안하며, 모델의 반복적 퇴행을 효과적으로 억제하는 방법을 다룹니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.