AI Briefing

Qwen3.6 큰 quant가 더 빠르다

Qwen3.6-35B-A3B - even in VRAM limited scenarios it can be better to use bigger quants than you'd expect!

·2026.04.25 06:49

핵심 내용

3070 8GB 환경에서 Qwen3.6-35B는 더 큰 quant가 더 높은 속도를 냈다.

자세히 보기

RTX 3070 8GB와 DDR4 64GB 환경에서 Qwen3.6-35B-A3B-UD를 돌린 결과, 예상보다 더 큰 quant가 더 나은 성능을 보였다.

  • IQ4_XS.gguf는 약 18GB 용량으로, 32k context에서 25~30 tok/s를 기록했다.
  • 더 큰 Q4_K_XL.gguf는 약 23GB임에도 128k context에서 32 tok/s로 더 빨랐다.
  • 최종적으로는 Q5_K_S가 품질과 속도의 균형이 가장 좋았고, 약 30 tok/s를 냈다.
  • 50k context에서도 속도는 25 tok/s 이상을 유지했다.

작성자는 MoE 모델에서는 VRAM이 빡빡해 보여도, 예상보다 상위 quant가 더 좋은 선택일 수 있다고 정리했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.