AI Briefing

5090서 77tps

Qwen3.5-27B on RTX 5090 served via vLLM @ 77 tps

·2026.04.21 09:44

핵심 내용

RTX 5090에서 Qwen3.5-27B를 vLLM로 서빙해 77 tps를 기록했다.

자세히 보기

RTX 5090에서 Qwen3.5-27B-Text-NVFP4-MTP를 vLLM 0.19로 서빙해 77 tps를 기록했다.

  • 컨텍스트 창: 218,592 토큰까지 동작
  • 동시 세션: 2개까지 가능, 다만 세션당 속도는 감소
  • 문제점: vLLM 0.19에서는 256k 풀 컨텍스트가 동작하지 않음
  • 대안: vLLM 0.17에서는 가이드대로 동작하지만 최적화 부족으로 tps가 떨어짐

재현용 설정도 함께 제시했다.

  • --gpu-memory-utilization 0.93
  • --attention-backend flashinfer
  • --performance-mode interactivity
  • --kv-cache-dtype fp8_e4m3
  • --max-num-seqs 2
  • --quantization modelopt
  • --enable-prefix-caching
  • --tool-call-parser qwen3_coder

또한 vLLM의 KV size 계산 수정 PR가 핵심이라고 언급했고, 모델 카드의 가이드는 유용하지만 테스트한 다른 모델은 성능이 기대만큼 좋지 않아 추천하지 않는다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.