3080서 40tok/s
GPoUr with ~12gb vram and a 3080 getting 40tg/s on qwen3.6 35BA3B w/ 260k ctx
·2026.04.17 05:23
핵심 내용
turbo3로 12GB VRAM 3080에서 Qwen3.6 35B A3B를 260k ctx로 약 40 tok/s 달성.
자세히 보기
GPU-POOR 컴파일 플래그와 turbo3 KV cache를 조합해, 약 12GB VRAM의 RTX 3080에서 Qwen3.6 35B A3B를 260k ctx로 약 40 tok/s까지 끌어올렸습니다.
사용한 구성:
- 컴파일:
GGML_CUDA_FA_ALL_QUANTS=ON,GGML_CUDA_F16=ON,GGML_CUDA_FORCE_MMQ=ON - 실행:
--ctx-size 0,--fit on,--flash-attn on,--cache-type-k turbo3,--cache-type-v turbo3,--reasoning off - 모델:
unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_M
작성자는 Qwen3.6의 thinking off 권장 설정을 적용했고, 프롬프트 하네스를 ask -> validate -> review -> refine/accept 단계로 구성했다고 밝혔습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.