AI Briefing

4-bit 양자화 및 QLoRA 공개

Making LLMs even more accessible with bitsandbytes, 4-bit quantization and QLoRA

·2023.05.24 09:00

4-bit 양자화와 QLoRA 기술을 통해 대규모 언어 모델을 적은 메모리로도 효율적으로 파인튜닝할 수 있게 되었다.

Hugging Face는 bitsandbytes 라이브러리와의 협업을 통해 모델을 4-bit 정밀도로 실행할 수 있는 기능을 공개했다. 이는 텍스트, 비전 등 다양한 모달리티의 Hugging Face 모델에 적용 가능하다.

특히 새롭게 도입된 QLoRA(Quantized Low-Rank Adaptation) 방식은 65B 파라미터 규모의 대형 모델을 단일 48GB GPU에서 파인튜닝할 수 있을 정도로 메모리 효율을 극대화했다. QLoRA는 16-bit 파인튜닝과 대등한 성능을 유지하면서도 다음과 같은 세 가지 핵심 기술을 사용한다:

  • 4-bit NormalFloat (NF4): 정규 분포를 따르는 가중치에 정보 이론적으로 최적화된 새로운 데이터 타입.
  • 이중 양자화(Double Quantization): 양자화에 사용되는 상수까지 다시 양자화하여 평균 메모리 점유율을 낮춤.
  • Paged Optimizers: 메모리 급증(Spike) 현상을 관리하기 위한 기술.

이 기술을 통해 사용자는 Google Colab과 같은 제한된 환경에서도 GPT-neo-X(20B)와 같은 대형 모델을 파인튜닝하거나 추론할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.