Qwen3.6 큰 quant가 더 빠르다
Qwen3.6-35B-A3B - even in VRAM limited scenarios it can be better to use bigger quants than you'd expect!
·2026.04.25 06:49
핵심 내용
3070 8GB 환경에서 Qwen3.6-35B는 더 큰 quant가 더 높은 속도를 냈다.
자세히 보기
RTX 3070 8GB와 DDR4 64GB 환경에서 Qwen3.6-35B-A3B-UD를 돌린 결과, 예상보다 더 큰 quant가 더 나은 성능을 보였다.
- IQ4_XS.gguf는 약 18GB 용량으로, 32k context에서 25~30 tok/s를 기록했다.
- 더 큰 Q4_K_XL.gguf는 약 23GB임에도 128k context에서 32 tok/s로 더 빨랐다.
- 최종적으로는 Q5_K_S가 품질과 속도의 균형이 가장 좋았고, 약 30 tok/s를 냈다.
- 50k context에서도 속도는 25 tok/s 이상을 유지했다.
작성자는 MoE 모델에서는 VRAM이 빡빡해 보여도, 예상보다 상위 quant가 더 좋은 선택일 수 있다고 정리했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.