AI Briefing
추천

Hugging Face, GGUF 모델 Transformers 지원

Transformers now runs llama.cpp quants

·2026.09.22 09:00

핵심 내용

Hugging Face Transformers가 llama.cpp의 GGUF 포맷을 직접 실행할 수 있게 되어 Apple Silicon에서 로컬 추론이 간편해졌다.

자세히 보기

Hugging Face Transformers에 llama.cpp의 GGUF 모델 실행 지원이 추가되었다. ggml 커널을 kernels 라이브러리로 재사용하여 from_pretrained API만으로 로컬 추론이 가능해졌다.

주요 기능 및 지원 범위

  • 초기 지원: Apple Silicon(MPS) 및 Qwen3.5 아키텍처(dense/MoE)에 한정됨
  • 양자화 지원: BF16부터 Q4_K_M까지 다양한 GGUF 양자화 파일 로드 가능
  • API 호환성: 로딩 후 표준 Transformers API(generate 등) 사용 가능
  • 서버 모드: transformers serve를 통해 OpenAI 호환 API 노출 가능

성능 및 한계

  • 성능 비교: MacBook Pro M2 Max 기준, Transformers가 llama.cpp와 유사한 토큰 생성 속도(tg128)를 기록
  • 현재 한계: Packed inference는 Apple Silicon 전용이며, Padding/Batching 미지원, 아키텍처 커버리지가 Qwen3.5/3.8에 제한됨
  • 활용 사례: Python/PyTorch 환경에서의 GGUF 모델 평가, Fine-tuning(dequantize 후), 커스텀 디코딩 실험 등에 유용

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.