AI Briefing

Self-Distillation이 Continual Learning을 가능하게 한다

·2026.05.17 10:19

핵심 내용

Self-Distillation Fine-Tuning으로 데모 학습의 망각을 줄였다.

자세히 보기

**Self-Distillation Fine-Tuning(SDFT)**을 제안해, 데모를 이용한 학습에서 on-policy 신호를 직접 만들고 이전 능력을 덜 잃게 했다.

핵심 아이디어는 demonstration-conditioned model을 자기 자신의 teacher로 써서, in-context learning을 활용한 자기 증류를 수행하는 것이다. 이를 통해 기존의 **supervised fine-tuning(SFT)**이 갖는 off-policy 한계를 완화한다.

실험에서는:

  • skill learning과 knowledge acquisition 과제에서 SFT보다 더 높은 새 과제 정확도를 보였다.
  • 동시에 catastrophic forgetting을 크게 줄였다.
  • sequential learning 설정에서는 하나의 모델이 여러 스킬을 시간에 따라 누적하면서도 성능 저하 없이 유지했다.

저자들은 이 결과가 데모 기반 학습에서 continual learning을 구현하는 실용적 경로로서, on-policy distillation의 가능성을 보여준다고 정리했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.