Diffusers, Nunchaku 4비트 양자화 공식 지원
Bringing Nunchaku 4-bit Diffusion Inference to Diffusers
·2026.07.23 09:00
Hugging Face Diffusers가 SVDQuant 기반 Nunchaku W4A4 양자화를 공식 통합해 VRAM 사용량을 절반으로 줄이고 추론 속도도 향상시켰다.
Nunchaku는 SVDQuant 기법을 사용하는 4비트 디퓨전 추론 엔진으로, 가중치와 활성화 모두 4비트(W4A4)로 실행해 기존 weight-only 양자화와 달리 속도까지 개선한다. 이번 Diffusers 통합으로 별도 추론 라이브러리 없이 from_pretrained()만으로 Nunchaku 체크포인트를 로드할 수 있게 됐다.
성능 비교 (RTX 5090, 1024×1024 이미지 생성)
- BF16: ~24 GB VRAM
- Nunchaku NVFP4: ~12 GB VRAM, 약 1.7초 생성
SVDQuant 핵심 원리: 활성화 이상치(outlier)를 가중치로 흡수하고, 가중치 행렬의 어려운 부분을 소규모 16비트 저랭크(low-rank) 브랜치로 표현한 뒤 나머지 잔차를 4비트로 양자화한다.
하드웨어 지원
- NVFP4: NVIDIA Blackwell GPU (RTX 50 시리즈, B200) 전용
- INT4: 이전 세대 GPU 지원
diffuse-compressor 툴킷을 통해 새 아키텍처를 직접 양자화해 Diffusers 저장소로 배포하는 것도 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.