5060 Ti로 35B 실측
What I got by 5060Ti 16GB + Qwen3.6-35B-A3B-UD-Q5_K_M
·2026.04.18 09:23
핵심 내용
RTX 5060 Ti 16GB에서 Qwen3.6-35B-A3B가 prebuilt 대비 약 10% 빨라졌다.
자세히 보기
AMD 9700X와 RTX 5060 Ti 16GB, 32GB RAM 조합에서 llama.cpp를 직접 빌드해 Qwen3.6-35B-A3B-UD-Q5_K_M를 측정했다.
- 실행 명령:
llama-bench.exe -m models\\Qwen3.6-35B-A3B-UD-Q5_K_M.gguf -ngl 99 --n-cpu-moe 22 -d 131072 -p 512 -n 128 --cache-type-k q8_0 --cache-type-v q8_0 -fa 1 -mmp 0 - 모델 파일 크기: 24.63 GiB
- 파라미터 수: 34.66B
- GPU 인식 정보: CUDA 장치 1개, VRAM 16,310 MiB, compute capability 12.0
벤치 결과는 다음과 같다.
- prompt processing: 628.10 t/s (
pp512 @ d131072) - token generation: 32.56 t/s (
tg128 @ d131072)
작성자는 prebuilt llama.cpp 대비 약 10% 성능 향상을 얻었다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.