AI Briefing

AI 자기 개선(RSI) 서베이 논문 공개

재귀적 자기 개선(RSI, Recursive Self-Improvement) 기법에 대한 서베이 연구 (1/2): 분류체계 및 배포 시점, 학습 시점의 자기 개선 루프 등

·2026.10.06 15:30

핵심 내용

arXiv 논문 1,250편 분석으로 배포/학습 시점 자기 개선 루프의 분류체계를 정립했다.

1 / 5

자세히 보기

arXiv 논문 1,250편을 분석해 재귀적 자기 개선(Recursive Self-Improvement, RSI)의 분류체계를 제시한 서베이 논문이 공개됐다. 연구는 개선 대상과 루프 폐쇄 정도를 기준으로 연구를 분류하며, 현재 대부분이 사람이 결과를 감사하는 '제한된 자기 정제(Bounded Self-Refinement)' 단계에 머물러 있음을 확인했다.

분류체계 및 코퍼스 분석

논문은 2024~2026년 발표된 1,250편의 논문을 바탕으로 개선 대상을 배포 시점 자기 진화, 학습 시점 자기 반복, 자기 평가, 자동 연구 등 4개 범주로 구분했다. 루프 폐쇄 정도는 Human-in-the-loop, Human-on-the-loop, Closed Loop 등 3단계로 정의했다. 코퍼스 분석 결과, 배포 시점 자기 진화(393편)와 학습 시점 자기 반복(340편)이 주를 이루며, 2026년 게시된 논문의 74%가 인용 수가 낮은 최신 연구로 편향되어 있다.

배포 시점 자기 진화: 출력 정제와 하네스

배포 시점 개선은 가중치를 변경하지 않고 출력, 하네스, 스킬을 수정하는 방식으로, 지속성이 낮은 출력 정제부터 무기한 축적되는 하네스/스킬 진화까지 포함한다. 진단 연구에 따르면 자기 교정은 유창성 개선에는 효과적이지만 내용 적절성 개선은 미미하며, 외부 피드백 없이 모델 자신의 분포로 수렴하는 경향이 있다. 최근에는 자율성 감소 대신 신뢰성을 높이기 위해 외부 신호(실행, 검색 등) 기반의 Human-on-the-loop 검증 정제로 회귀하고 있다.

학습 시점 자기 반복: 가중치 갱신과 검증의 중요성

학습 시점 개선은 모델이 자기 생성 데이터나 보상 신호로 가중치를 갱신하는 방식으로, 산업 표준에 가장 가깝다. Self-Rewarding LMs, On-Policy Self-Distillation(OPSD) 등 다양한 패러다임이 등장했으나, 검증 신호의 품질이 개선의 상한을 결정한다. 특히 검증 가능한 이진 보상 사용 시에도 '상승 후 붕괴(Rise-and-Collapse)' 현상이 보고되며, 보상 모델 오정렬 없이도 최적화 동역학만으로 성능이 퇴보할 수 있다. 루프는 능력과 편향을 똑같이 효율적으로 전달하므로, 검증기 없는 축적은 오염된 스킬 전파나 안전성 표류 위험을 초래한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.