Qwen 3.6 27B GGUF 비교
Qwen 3.6 27B BF16 vs Q4_K_M vs Q8_0 GGUF evaluation
·2026.04.28 21:18
Qwen 3.6 27B의 BF16·Q4_K_M·Q8_0 양자화 성능을 비교했다.
Qwen 3.6 27B를 BF16, Q4_K_M, Q8_0 GGUF로 나눠 llama-cpp-python 환경에서 평가했다.
비교 항목은 HumanEval(164샘플), HellaSwag(100샘플), BFCL(400샘플) 이었고, n_ctx 32768과 체크포인트 기반 실행을 사용했다.
- BF16: 평균 정확도 69.78%, 15.5 tok/s, 피크 RAM 54GB, 모델 크기 53.8GB
- Q4_K_M: 평균 정확도 66.54%, 22.5 tok/s, 피크 RAM 28GB, 모델 크기 16.8GB
- Q8_0: 평균 정확도 66.15%, 18.0 tok/s, 피크 RAM 42GB, 모델 크기 28.6GB
세부적으로는 Q4_K_M이 가장 실용적인 선택으로 제시됐다. BFCL 점수는 BF16과 거의 같았고, HumanEval은 약 5.5점 낮았지만 HellaSwag에서는 4점 차이에 그쳤다.
정리하면:
- Q4_K_M은 BF16 대비 약 1.45배 빠르고 RAM 사용량이 48% 적다.
- Q8_0은 HumanEval이 Q4_K_M보다 약간 높았지만, RAM과 속도 면에서 이점이 작았다.
- 최고 품질만 보면 BF16이 우세했고, 로컬/CPU 배포에서는 Q4_K_M이 유력한 선택지로 제안됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.