Transformers GPTQ 지원
Making LLMs lighter with AutoGPTQ and transformers
·2023.08.23 09:00
Hugging Face가 Transformers에 AutoGPTQ를 통합하여 LLM의 2~8비트 양자화를 지원한다.
Hugging Face가 AutoGPTQ 라이브러리를 Transformers에 통합하여, GPTQ 알고리즘을 통한 2, 3, 4, 8비트 정밀도 양자화를 지원한다.
GPTQ는 사후 학습 양자화(PTQ) 방식으로, 4비트 양자화 시 정확도 손실을 최소화하면서도 메모리 사용량을 약 4배 절감할 수 있다. 또한 가중치 비트 폭을 낮춰 데이터 통신 시간을 줄임으로써 추론 속도 향상을 기대할 수 있다.
주요 지원 사항은 다음과 같다:
- 하드웨어: Nvidia GPU 및 RoCm 기반 AMD GPU 지원
- 워크플로우: Optimum을 통한 양자화, Text-Generation-Inference를 통한 모델 실행, PEFT를 활용한 양자화 모델 미세 조정 지원
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.