AI Briefing

Diffusers, Nunchaku 4비트 양자화 공식 지원

Bringing Nunchaku 4-bit Diffusion Inference to Diffusers

·2026.07.23 09:00

핵심 내용

Hugging Face Diffusers가 SVDQuant 기반 Nunchaku W4A4 양자화를 공식 통합해 VRAM 사용량을 절반으로 줄이고 추론 속도도 향상시켰다.

1 / 2

자세히 보기

Nunchaku는 SVDQuant 기법을 사용하는 4비트 디퓨전 추론 엔진으로, 가중치와 활성화 모두 4비트(W4A4)로 실행해 기존 weight-only 양자화와 달리 속도까지 개선한다. 이번 Diffusers 통합으로 별도 추론 라이브러리 없이 from_pretrained()만으로 Nunchaku 체크포인트를 로드할 수 있게 됐다.

성능 비교 (RTX 5090, 1024×1024 이미지 생성)

  • BF16: ~24 GB VRAM
  • Nunchaku NVFP4: ~12 GB VRAM, 약 1.7초 생성

SVDQuant 핵심 원리: 활성화 이상치(outlier)를 가중치로 흡수하고, 가중치 행렬의 어려운 부분을 소규모 16비트 저랭크(low-rank) 브랜치로 표현한 뒤 나머지 잔차를 4비트로 양자화한다.

하드웨어 지원

  • NVFP4: NVIDIA Blackwell GPU (RTX 50 시리즈, B200) 전용
  • INT4: 이전 세대 GPU 지원

diffuse-compressor 툴킷을 통해 새 아키텍처를 직접 양자화해 Diffusers 저장소로 배포하는 것도 가능하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.