Transformers GPTQ 지원
Making LLMs lighter with AutoGPTQ and transformers
·2023.08.23 09:00
핵심 내용
Hugging Face가 Transformers에 AutoGPTQ를 통합하여 LLM의 2~8비트 양자화를 지원한다.
자세히 보기
Hugging Face가 AutoGPTQ 라이브러리를 Transformers에 통합하여, GPTQ 알고리즘을 통한 2, 3, 4, 8비트 정밀도 양자화를 지원한다.
GPTQ는 사후 학습 양자화(PTQ) 방식으로, 4비트 양자화 시 정확도 손실을 최소화하면서도 메모리 사용량을 약 4배 절감할 수 있다. 또한 가중치 비트 폭을 낮춰 데이터 통신 시간을 줄임으로써 추론 속도 향상을 기대할 수 있다.
주요 지원 사항은 다음과 같다:
- 하드웨어: Nvidia GPU 및 RoCm 기반 AMD GPU 지원
- 워크플로우: Optimum을 통한 양자화, Text-Generation-Inference를 통한 모델 실행, PEFT를 활용한 양자화 모델 미세 조정 지원
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.