4장 5060 Ti vLLM 벤치
5060ti quad-chads - vllm (the reluctant arc) - pp and tg talk
·2026.04.30 01:59
핵심 내용
4장 5060 Ti에서 vLLM pp 1444.9 tok/s, tg 47.4 tok/s를 기록했다.
자세히 보기
브라우저 자동차 레이싱 게임용 초장문 프롬프트를 처리하려고 4장 5060 Ti에서 vLLM을 돌렸고, pp와 tg 처리량을 함께 측정했다.
- 모델: Qwen/Qwen3.6-27B-FP8
- 설정:
tensor-parallel-size 4,max-model-len 262144,speculative-config의qwen3_next_mtp,num_speculative_tokens=2 - 추가 옵션:
fp8양자화,max-num-seqs 2,enable-prefix-caching,enable-auto-tool-choice,qwen3_coder파서,language-model-only - 설치:
uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly
측정값
>10k토큰 프롬프트 처리(pp): 1,444.9 tok/s- 생성(tg): 47.4 tok/s
- 로그상 draft acceptance rate: **70.4%**와 97.6%
서비스는 systemd로 등록해 journalctl -f -u vllm.service로 로그를 확인했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.