AI Briefing

3080서 40tok/s

GPoUr with ~12gb vram and a 3080 getting 40tg/s on qwen3.6 35BA3B w/ 260k ctx

·2026.04.17 05:23

핵심 내용

turbo3로 12GB VRAM 3080에서 Qwen3.6 35B A3B를 260k ctx로 약 40 tok/s 달성.

자세히 보기

GPU-POOR 컴파일 플래그와 turbo3 KV cache를 조합해, 약 12GB VRAM의 RTX 3080에서 Qwen3.6 35B A3B를 260k ctx로 약 40 tok/s까지 끌어올렸습니다.

사용한 구성:

  • 컴파일: GGML_CUDA_FA_ALL_QUANTS=ON, GGML_CUDA_F16=ON, GGML_CUDA_FORCE_MMQ=ON
  • 실행: --ctx-size 0, --fit on, --flash-attn on, --cache-type-k turbo3, --cache-type-v turbo3, --reasoning off
  • 모델: unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_M

작성자는 Qwen3.6의 thinking off 권장 설정을 적용했고, 프롬프트 하네스를 ask -> validate -> review -> refine/accept 단계로 구성했다고 밝혔습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.