AI Briefing

FTPO를 활용한 LLM 반복 생성 문제 해결

Reducing Doom Loops with Final Token Preference Optimization

·2026.07.08 06:58

LLM의 반복적 생성 오류인 'Doom Loop'를 해결하기 위한 새로운 최적화 방법론을 제안한다.

모델이 특정 문구(예: "Wait, let me reconsider...")를 무한히 반복하며 컨텍스트를 소진하는 'Doom Loop' 현상은 특히 추론 능력을 갖춘 소형 모델에서 빈번하게 발생합니다.

기존의 해결책과 한계는 다음과 같습니다.

  • Repetition Penalty: 추론 시 출력 분포를 재조정하지만, 성능 저하를 유발할 수 있는 임시방편적 해결책임.
  • Reinforcement Learning: 반복 문제를 타겟팅할 수 있으나, 정교한 보상 설계와 비용이 많이 드는 온라인 롤아웃(Online Rollouts)이 필요함.

본 논문은 이러한 문제를 해결하기 위해 Final Token Preference Optimization(FTPO) 방식을 제안하며, 모델의 반복적 퇴행을 효과적으로 억제하는 방법을 다룹니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.