Hugging Face, Transformers에 GGUF 네이티브 지원 도입
GGUFs in transformers natively!
·2026.09.23 14:57
핵심 내용
Hugging Face가 Transformers 라이브러리에 GGUF 형식 네이티브 지원을 추가해 로컬 양자화 모델의 디버깅과 유연한 사용을 가능하게 했다.
자세히 보기
Hugging Face가 transformers 라이브러리에 GGUF 형식의 네이티브 지원 기능을 도입했다. 이를 통해 사용자는 AutoModelForCausalLM에서 gguf_file 파라미터를 지정하여 llama.cpp 기반의 양자화 모델을 직접 로드하고, 기존 PyTorch 기반의 Transformers API를 그대로 활용할 수 있다.
주요 목적 및 이점
- 디버깅 및 유연성: PyTorch 생태계의 도구를 그대로 사용하여 모델 디버깅, 평가, 커스텀 생성 로직 구현이 훨씬 수월해진다.
- 하드웨어 호환성: Apple Silicon(M2 Max 등) 환경에서는 ggml 커널을 재사용하여 양자화된 가중치 그대로 실행할 수 있다.
- 성능 비교: 테스트 결과, Transformers는 llama.cpp와 유사한 추론 속도를 보였다. Qwen3.5-4B(Q4_K_M) 기준 초당 70.4토큰(llama.cpp 71.8토큰), Qwen3.8-27B(UD-Q4_K_M) 기준 초당 15.9토큰(llama.cpp 13.4토큰)을 기록했다.
사용 목적
이 기능은 최대 로컬 추론 성능을 위한 llama.cpp를 대체하기 위한 것이 아니다. 대신, 동일한 GGUF 모델을 더 유연하고 개발 친화적인 PyTorch 환경에서 사용할 수 있게 하는 데 초점이 맞춰져 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.