AsymFlow, 픽셀 공간 SOTA
AsymFlow Claims More Realistic AI Images by Moving Beyond Latent Diffusion
·2026.05.17 22:00
Stanford 연구진이 AsymFlow로 latent diffusion보다 더 사실적인 AI 이미지를 제시했다.
Stanford 연구진이 **Asymmetric Flow Models(AsymFlow)**를 제안했다. 고차원 pixel-space 생성에서 노이즈 예측은 저랭크 subspace로 제한하고, 데이터 예측은 전체 차원을 유지하는 rank-asymmetric velocity parameterization이다.
이 설계는 네트워크 아키텍처나 training/sampling 절차를 바꾸지 않고도 전체 velocity를 해석적으로 복원한다.
주요 결과는 다음과 같다.
- ImageNet 256x256에서 FID 1.57을 기록했다.
- 기존 DiT/JiT 계열 pixel diffusion 모델보다 큰 폭으로 앞섰다고 밝혔다.
- 미리 학습된 latent flow model을 pixel-space 모델로 fine-tuning하는 경로를 제시했다.
- FLUX.2 klein 9B 기반 AsymFLUX.2 klein은 HPSv3, DPG-Bench, GenEval에서 latent base를 넘어섰다.
저자들은 이 방식이 고수준 의미와 구조를 유지한 채, 주로 저수준 디테일과 질감을 보정하게 만든다고 설명했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.