4070S 12GB 로컬 LLM 속도
12GB-Club: 4070S qwen3.6 27b + 35b a3b, and Gemma 4 26b a4b + 31b speeds
·2026.05.01 00:29
RTX 4070S 12GB에서 Qwen3.6·Gemma 4 로컬 추론 속도를 공개했다.
RTX 4070S 12GB(+10% OC), Ryzen 9800X3D, DDR5 64GB 환경에서 로컬 모델 속도를 측정했다.
디스플레이 출력을 iGPU로 넘겨 RTX VRAM을 절약했고, CUDA 13.1과 llama.cpp 설정을 사용했다. 핵심 값은 n-gpu-layers=999, batch-size=4096, ctx-size=65536, cache-ram=2048, kv-unified=true, flash-attn=true이며, Qwen3.6-35B-A3B는 ctx-size=131072, n-cpu-moe=35로 돌렸다.
모델별 결과는 다음과 같다.
Qwen3.6-35B-A3B-GGUF Q6_K_XL: tgs 40, pps 2100Qwen3.6-27B-IQ3_XXS: tgs 16, pps 1000Gemma 4 26B-A4B-it-UD-Q8: tgs 26, pps 2150Gemma-4-31B-it-IQ3_XXS: tgs 13~16, pps 650
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.