AI Briefing

4장 5060 Ti vLLM 벤치

5060ti quad-chads - vllm (the reluctant arc) - pp and tg talk

·2026.04.30 01:59

핵심 내용

4장 5060 Ti에서 vLLM pp 1444.9 tok/s, tg 47.4 tok/s를 기록했다.

자세히 보기

브라우저 자동차 레이싱 게임용 초장문 프롬프트를 처리하려고 4장 5060 Ti에서 vLLM을 돌렸고, pp와 tg 처리량을 함께 측정했다.

  • 모델: Qwen/Qwen3.6-27B-FP8
  • 설정: tensor-parallel-size 4, max-model-len 262144, speculative-config의 qwen3_next_mtp, num_speculative_tokens=2
  • 추가 옵션: fp8 양자화, max-num-seqs 2, enable-prefix-caching, enable-auto-tool-choice, qwen3_coder 파서, language-model-only
  • 설치: uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly

측정값

  • >10k 토큰 프롬프트 처리(pp): 1,444.9 tok/s
  • 생성(tg): 47.4 tok/s
  • 로그상 draft acceptance rate: **70.4%**와 97.6%

서비스는 systemd로 등록해 journalctl -f -u vllm.service로 로그를 확인했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.