4070S 12GB 로컬 LLM 속도
12GB-Club: 4070S qwen3.6 27b + 35b a3b, and Gemma 4 26b a4b + 31b speeds
·2026.05.01 00:29
핵심 내용
RTX 4070S 12GB에서 Qwen3.6·Gemma 4 로컬 추론 속도를 공개했다.
자세히 보기
RTX 4070S 12GB(+10% OC), Ryzen 9800X3D, DDR5 64GB 환경에서 로컬 모델 속도를 측정했다.
디스플레이 출력을 iGPU로 넘겨 RTX VRAM을 절약했고, CUDA 13.1과 llama.cpp 설정을 사용했다. 핵심 값은 n-gpu-layers=999, batch-size=4096, ctx-size=65536, cache-ram=2048, kv-unified=true, flash-attn=true이며, Qwen3.6-35B-A3B는 ctx-size=131072, n-cpu-moe=35로 돌렸다.
모델별 결과는 다음과 같다.
Qwen3.6-35B-A3B-GGUF Q6_K_XL: tgs 40, pps 2100Qwen3.6-27B-IQ3_XXS: tgs 16, pps 1000Gemma 4 26B-A4B-it-UD-Q8: tgs 26, pps 2150Gemma-4-31B-it-IQ3_XXS: tgs 13~16, pps 650
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.