AI Briefing

5060 Ti로 35B 실측

What I got by 5060Ti 16GB + Qwen3.6-35B-A3B-UD-Q5_K_M

·2026.04.18 09:23

핵심 내용

RTX 5060 Ti 16GB에서 Qwen3.6-35B-A3B가 prebuilt 대비 약 10% 빨라졌다.

자세히 보기

AMD 9700X와 RTX 5060 Ti 16GB, 32GB RAM 조합에서 llama.cpp를 직접 빌드해 Qwen3.6-35B-A3B-UD-Q5_K_M를 측정했다.

  • 실행 명령: llama-bench.exe -m models\\Qwen3.6-35B-A3B-UD-Q5_K_M.gguf -ngl 99 --n-cpu-moe 22 -d 131072 -p 512 -n 128 --cache-type-k q8_0 --cache-type-v q8_0 -fa 1 -mmp 0
  • 모델 파일 크기: 24.63 GiB
  • 파라미터 수: 34.66B
  • GPU 인식 정보: CUDA 장치 1개, VRAM 16,310 MiB, compute capability 12.0

벤치 결과는 다음과 같다.

  • prompt processing: 628.10 t/s (pp512 @ d131072)
  • token generation: 32.56 t/s (tg128 @ d131072)

작성자는 prebuilt llama.cpp 대비 약 10% 성능 향상을 얻었다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.