2x 5060 Ti Qwen3.6 벤치마크
2 x 5060 ti: Any better configs for Qwen 3.6 27B / 35B?
·2026.04.28 04:37
핵심 내용
2x 5060 Ti 16GB에서 Qwen3.6 27B와 35B-A3B를 여러 엔진으로 비교했다.
자세히 보기
2장 구성의 RTX 5060 Ti 16GB 환경에서 Qwen3.6-27B와 Qwen3.6-35B-A3B를 여러 설정으로 측정했다.
- 측정 도구는
llama-benchy 0.3.5였고,--pp 4096 --tg 128 --depth 0 --runs 3 --latency-mode generation --no-cache조건을 사용했다. - Qwen3.6-27B에서는
vLLM의 NVFP4-MTP, TP2-PP1, no spec 조합이 PP 1963 t/s, TG 38.4 t/s, TTFT 2182ms로 PP 처리량이 가장 높았다. - 같은 모델에서
vLLM의 Lorbus/Intel AutoRound 계열은 대체로 PP 1044~1088 t/s, TG 40.2~46.9 t/s, TTFT 3792~4008ms 수준이었다. ik-llama.cpp는 IQ4_XS layer + q8_0 KV에서 PP 1450 t/s, TG 28.4 t/s, TTFT 2945ms를, tensor + f16 KV에서는 더 낮은 PP와 더 높은 TTFT를 보였다.- Qwen3.6-35B-A3B는
vLLM의 NVFP4, TP2-PP1, no spec 조합이 PP 6259 t/s, TG 116.5 t/s, TTFT 753ms로 가장 좋았다. - 반면
vLLM의 DFlash n=15는 TG 38.9 t/s로 떨어졌고,ik-llama.cpp는 Unsloth Q4_K_XL layer + q8_0 KV에서 TG 108.9 t/s를 기록했다.
작성자는 speculative decoding이 PCIe 대역폭 제한 때문에 사실상 실패했다고 밝혔고, 추가로 더 큰 pp/tg 설정으로 재측정할 계획이라고 했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.