듀얼 RTX 5060 Ti에서 Qwen3.6 27B, 60 tok/s
Qwen3.6 27B on dual RTX 5060 Ti 16GB with vLLM: ~60 tok/s, 204k context working
·2026.04.29 17:40
듀얼 RTX 5060 Ti 16GB에서 Qwen3.6 27B가 약 60 tok/s로 돌아갔다.
듀얼 RTX 5060 Ti 16GB와 CUDA 13 / Torch 2.11 nightly, vLLM nightly 0.19.2rc1.dev 조합에서 sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP를 구동해 성능을 측정했다.
- 8K context에서 MTP n=1은 50~52 tok/s, n=3은 62~66 tok/s를 기록했다.
- 32K context에서도 59~66 tok/s를 유지했다.
- 204,800 context 시작과 동작이 확인됐고, 168k-token prefill 후 GPU당 VRAM은 15.65GiB였다.
- 유휴 VRAM은 GPU당 14.45GiB였으며, 168k-token needle/retrieval smoke test는 약 256초에 통과했다.
- 한도 초과 프롬프트+출력은 정상적으로 거부됐다.
실행은 --tensor-parallel-size 2, --max-model-len 204800, --kv-cache-dtype fp8, --quantization modelopt, --attention-backend TRITON_ATTN 설정으로 맞췄다. gpu_memory_utilization=0.94는 KV 할당에 실패했고 0.95에서만 통과했다.
생각 모드도 동작하지만 max_tokens가 너무 낮으면 최종 출력을 못 내므로 **1024+**가 필요하고, 실제 추론에는 4096~8192가 더 안전했다. 시작에는 컴파일·오토튜닝 때문에 수분이 걸렸고, FlashInfer autotuner의 OOM fallback 로그가 떠도 서버는 정상 기동했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.