AI Briefing

4070S 12GB 로컬 LLM 속도

12GB-Club: 4070S qwen3.6 27b + 35b a3b, and Gemma 4 26b a4b + 31b speeds

·2026.05.01 00:29

핵심 내용

RTX 4070S 12GB에서 Qwen3.6·Gemma 4 로컬 추론 속도를 공개했다.

자세히 보기

RTX 4070S 12GB(+10% OC), Ryzen 9800X3D, DDR5 64GB 환경에서 로컬 모델 속도를 측정했다.

디스플레이 출력을 iGPU로 넘겨 RTX VRAM을 절약했고, CUDA 13.1과 llama.cpp 설정을 사용했다. 핵심 값은 n-gpu-layers=999, batch-size=4096, ctx-size=65536, cache-ram=2048, kv-unified=true, flash-attn=true이며, Qwen3.6-35B-A3B는 ctx-size=131072, n-cpu-moe=35로 돌렸다.

모델별 결과는 다음과 같다.

  • Qwen3.6-35B-A3B-GGUF Q6_K_XL: tgs 40, pps 2100
  • Qwen3.6-27B-IQ3_XXS: tgs 16, pps 1000
  • Gemma 4 26B-A4B-it-UD-Q8: tgs 26, pps 2150
  • Gemma-4-31B-it-IQ3_XXS: tgs 13~16, pps 650

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.