양자화 순위전
GGUF Quants Arena for MMLU (24GB VRAM + 128GB RAM)
·2026.04.16 18:38
핵심 내용
24GB VRAM 환경에서 GGUF 양자화 모델들의 MMLU 점수를 비교했다.
자세히 보기
MMLU subset(DEV+TEST) 기준으로 llama.cpp 환경에서 GGUF 양자화 모델들을 비교했다.
- 설정: ctx 8192, seed 42, fa on
- 상위권은 **Qwen3.5-27B-UD-Q5_K_XL.gguf 87.33%**와 **Qwen3.5-27B-UD-Q4_K_XL.gguf 87.25%**로 거의 차이가 없었다.
- 그다음은 **Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled.i1-Q4_K_M.gguf 87.02%**였다.
- Qwen3-Coder-Next-UD-Q4_K_XL.gguf는 **84.38%**로 뒤를 이었고, Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf는 **83.25%**를 기록했다.
- 더 작은 Qwen3.5-9B-UD-Q8_K_XL.gguf는 78.81%, gemma-4-31B-it-UD-Q4_K_XL.gguf는 **78.36%**였으며 errors=1이 표시됐다.
- 가장 큰 모델인 Qwen3.5-397B-A17B-UD-IQ2_XXS-00001-of-00004.gguf는 **65.80%**로 상대적으로 낮았다.
같은 조건에서 여러 GGUF 양자화 조합의 MMLU 성능 차이를 한눈에 보여주는 벤치마크 비교다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.