JiT-DDT 아키텍처, Linum v2 대비 텍스트-이미지 모델 학습 속도 3.6배 향상
·2026.09.17 01:58
핵심 내용
픽셀 공간 기반의 인코더-디코더 구조를 채택한 JiT-DDT 아키텍처가 Linum v2 대비 GPU 사용량을 3.6배 줄이면서 더 빠른 수렴과 개선된 이미지 품질을 달성했다.
1 / 11
자세히 보기
연구팀은 픽셀 공간 DiT를 인코더-디코더 구조(JiT-DDT)로 분할하여 학습 효율성을 높였다. 이 아키텍처는 기존 Linum v2 대비 GPU-hours를 3.6배 줄이면서도 4배 더 많은 픽셀을 생성하며, x-prediction 방식을 사용한다.
핵심 기술 및 구조
- 인코더-디코더 분할: 인코더는 64x64 해상도의 구조를 예측하고, 디코더는 텍스트 조건과 인코더의 hidden states를 활용해 512x512 이미지를 생성한다. 인코더와 디코더는 동일한 크기를 가지며, 디코더는 텍스트 조건을 직접 참조한다.
- PixelREPA 적용: DINOv3 특성을 활용해 인코더의 hidden state를 정렬함으로써 학습 안정성을 확보했다.
성능 및 학습 전략
- 수렴 및 품질: JiT 대비 학습 속도는 약 28% 느리지만, 수렴 속도는 더 빠르고 과포화 현상이 감소하여 최종 이미지 품질이 시각적으로 10-20% 개선된 것으로 평가된다.
- Noise Schedule: 학습 과정에서 노이즈 분포를 조정하여 디테일 회복을 유도했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.