Qwen 3.6 35B GGUF 공개
Qwen 3.6 35B GGUF: NTP vs MTP quantization results across GPUs and CPUs
·2026.05.21 00:42
ByteShape가 Qwen 3.6 35B GGUF NTP·MTP 양자화와 벤치마크를 공개했다.
ByteShape가 Qwen 3.6 35B GGUF를 NTP와 MTP 두 계열로 공개했다.
- NTP에서는 “들어가는 가장 큰 quant를 고르는 전략”이 가장 안정적으로 작동했다.
- 더 낮은 bpw가 항상 더 빠르거나 더 좋지는 않았고, 가장 큰 배포본이 품질과 속도에서 자주 우위를 보였다.
- MTP는 GPU 생성 속도를 대체로 20~40% 끌어올렸지만, 추가 메모리 사용량 때문에 실제로는 탑재 가능 구성이 달라질 수 있다.
- MTP의 이득은 워크로드 의존적이어서, 모든 상황에서 일관된 속도 향상을 보장하지는 않았다.
- CPU 환경에서는 MTP의 매력이 낮아, CPU 권장안은 여전히 NTP였다.
- 비교 신호를 흐릴 수 있다는 이유로 MMLU는 이번 릴리스에서 제외됐다.
비교는 단순한 모델 업로드가 아니라 소규모 하드웨어 스터디에 가깝게 구성됐고, RTX 4090, 5090, Pro 6000, 4080, 5060 Ti와 Intel i7, Intel Ultra 7, Ryzen 9, Raspberry Pi 5까지 폭넓게 측정했다.
실무적으로는, 같은 모델이라도 더 작은 bpw가 항상 정답은 아니며, 메모리 여유가 있으면 더 큰 quant가 품질과 속도에서 더 나은 선택이 될 수 있다는 점을 강조한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.