AI Briefing

RTX 5090 24GB에서 100t/s

Qwen3.6-27B at 85-100 t/s on a 24GB RTX 5090 Laptop GPU — vLLM + MTP n=3, adapted from the 32GB recipes

·2026.04.26 02:53

핵심 내용

24GB RTX 5090 Laptop GPU에서 Qwen3.6-27B를 85~100 t/s로 구동했다.

자세히 보기

Olares One의 RTX 5090 Laptop GPU 24GB에서 Qwen3.6-27B를 vLLM으로 돌린 결과, 85~100 t/s를 기록했다.

  • MTP n=3 적용 후 워밍업 뒤 92~95% acceptance를 유지했다.
  • 최대 컨텍스트는 75K였고, 피크는 99.7 t/s였다.
  • 같은 하드웨어의 llama.cpp UD-Q4_K_XL/NVFP4 GGUF는 33~36 t/s, vLLM v0.17 NVFP4는 39 t/s였다.
  • vLLM 0.19.1의 NVFP4 + MTP n=1 조합은 mtp.fc용 2.37 GiB BF16 버퍼 때문에 OOM이 났다.
  • Lorbus/Qwen3.6-27B-int4-AutoRound로 바꾸면 MTP만 BF16로 남겨 n=1 65 t/s, n=3 85~100 t/s까지 올라갔다.
  • 작성자는 이 조합이 llama.cpp 대비 약 3배 빠르다고 정리했고, 5090 32GB 참고값(78~80 t/s)과도 비슷하거나 높다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.