추천
Hugging Face, GGUF 모델 Transformers 지원
Transformers now runs llama.cpp quants
·2026.09.22 09:00
핵심 내용
Hugging Face Transformers가 llama.cpp의 GGUF 포맷을 직접 실행할 수 있게 되어 Apple Silicon에서 로컬 추론이 간편해졌다.
자세히 보기
Hugging Face Transformers에 llama.cpp의 GGUF 모델 실행 지원이 추가되었다. ggml 커널을 kernels 라이브러리로 재사용하여 from_pretrained API만으로 로컬 추론이 가능해졌다.
주요 기능 및 지원 범위
- 초기 지원: Apple Silicon(MPS) 및 Qwen3.5 아키텍처(dense/MoE)에 한정됨
- 양자화 지원: BF16부터 Q4_K_M까지 다양한 GGUF 양자화 파일 로드 가능
- API 호환성: 로딩 후 표준 Transformers API(
generate등) 사용 가능 - 서버 모드:
transformers serve를 통해 OpenAI 호환 API 노출 가능
성능 및 한계
- 성능 비교: MacBook Pro M2 Max 기준, Transformers가 llama.cpp와 유사한 토큰 생성 속도(tg128)를 기록
- 현재 한계: Packed inference는 Apple Silicon 전용이며, Padding/Batching 미지원, 아키텍처 커버리지가 Qwen3.5/3.8에 제한됨
- 활용 사례: Python/PyTorch 환경에서의 GGUF 모델 평가, Fine-tuning(dequantize 후), 커스텀 디코딩 실험 등에 유용
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.