LLM 메모리 절감용 8비트 양자화
A Gentle Introduction to 8-bit Matrix Multiplication for transformers at scale using transformers, accelerate and bitsandbytes
·2022.08.17 09:00
대규모 언어 모델의 메모리 사용량을 2배 줄이면서 성능을 유지하는 8비트 양자화 기술과 Hugging Face 라이브러리 통합을 설명한다.
대규모 언어 모델(LLM)의 파라미터 수가 급증함에 따라 막대한 GPU 메모리 요구량이 발생하고 있다. 예를 들어 BLOOM-176B 모델의 추론에는 80GB A100 GPU 8대가 필요하며, 미세 조정에는 72대가 필요할 정도다.
이러한 문제를 해결하기 위해 양자화(Quantization) 기술이 도입되었다. Hugging Face는 LLM.int8() 연구를 transformers 라이브러리에 통합하여, 모델 성능 저하 없이 메모리 점유율을 약 2배 줄이는 방법을 제시한다.
주요 부동 소수점 데이터 타입의 차이는 다음과 같다:
- FP32: 높은 정밀도를 제공하지만 메모리 소모가 매우 크다.
- FP16: 메모리 효율은 좋으나 표현 범위가 좁아 오버플로(Overflow) 위험이 있다.
- BF16: FP32와 동일한 지수 범위를 가져 오버플로를 방지하지만, FP16보다 정밀도가 낮다.
이번 통합을 통해 개발자는 bitsandbytes 라이브러리를 사용하여 대규모 모델을 더 적은 자원으로 효율적으로 실행하고 미세 조정할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.