AI Briefing

Training-Free Diffusion Editing을 위한 Self-Attention 분해

·2026.05.13 12:04

Self-Attention 가중치를 분해해 추가 학습 없이 diffusion 편집 방향을 찾았다.

사전학습된 diffusion modelsself-attention 가중치에서 의미론적 편집 방향을 직접 뽑아낸다. 별도 학습이나 대규모 샘플링 없이 eigen decomposition으로 latent 편집 축을 찾고, 얼굴의 나이·헤어스타일·눈 크기 같은 속성을 정밀하게 바꾼다.

핵심은 초기 denoising 구간인 0.5T~0.8T에서 특징 공분산이 항등행렬에 가까운 latent whitening 가정이다. 이 구간에서 Q/K/V projection matrices를 묶은 결합 가중치 C의 주요 고유벡터를 편집 방향으로 해석하고, latent를 Z' = Z + αn 형태로 바꿔 원하는 변화를 만든다.

  • α를 -0.4~0.4로 바꾸면 편집 강도가 선형적으로 변한다.
  • CelebA-HQ에서 15개 semantic direction과 100개 샘플, 총 1,500개 케이스로 평가했다.
  • SSIM, PSNR, FaceNet cosine similarity(ID-Similarity), Directional CLIP에서 기존 방법을 앞섰다.
  • 편집 시간은 약 3초 수준이며, 기존 대비 60% 빠르다고 제시한다.
  • LSUN의 Cars, Cats, Rooms 등 다른 사전학습 모델에도 적용돼 sample-independent한 범용성을 보였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.