AI Briefing

Self-Distillation이 Continual Learning을 가능하게 한다

·2026.05.17 10:19

Self-Distillation Fine-Tuning으로 데모 학습의 망각을 줄였다.

**Self-Distillation Fine-Tuning(SDFT)**을 제안해, 데모를 이용한 학습에서 on-policy 신호를 직접 만들고 이전 능력을 덜 잃게 했다.

핵심 아이디어는 demonstration-conditioned model을 자기 자신의 teacher로 써서, in-context learning을 활용한 자기 증류를 수행하는 것이다. 이를 통해 기존의 **supervised fine-tuning(SFT)**이 갖는 off-policy 한계를 완화한다.

실험에서는:

  • skill learningknowledge acquisition 과제에서 SFT보다 더 높은 새 과제 정확도를 보였다.
  • 동시에 catastrophic forgetting을 크게 줄였다.
  • sequential learning 설정에서는 하나의 모델이 여러 스킬을 시간에 따라 누적하면서도 성능 저하 없이 유지했다.

저자들은 이 결과가 데모 기반 학습에서 continual learning을 구현하는 실용적 경로로서, on-policy distillation의 가능성을 보여준다고 정리했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.