RTX 5090 24GB에서 100t/s
Qwen3.6-27B at 85-100 t/s on a 24GB RTX 5090 Laptop GPU — vLLM + MTP n=3, adapted from the 32GB recipes
·2026.04.26 02:53
핵심 내용
24GB RTX 5090 Laptop GPU에서 Qwen3.6-27B를 85~100 t/s로 구동했다.
자세히 보기
Olares One의 RTX 5090 Laptop GPU 24GB에서 Qwen3.6-27B를 vLLM으로 돌린 결과, 85~100 t/s를 기록했다.
- MTP n=3 적용 후 워밍업 뒤 92~95% acceptance를 유지했다.
- 최대 컨텍스트는 75K였고, 피크는 99.7 t/s였다.
- 같은 하드웨어의 llama.cpp UD-Q4_K_XL/NVFP4 GGUF는 33~36 t/s, vLLM v0.17 NVFP4는 39 t/s였다.
- vLLM 0.19.1의 NVFP4 + MTP n=1 조합은
mtp.fc용 2.37 GiB BF16 버퍼 때문에 OOM이 났다. Lorbus/Qwen3.6-27B-int4-AutoRound로 바꾸면 MTP만 BF16로 남겨 n=1 65 t/s, n=3 85~100 t/s까지 올라갔다.- 작성자는 이 조합이 llama.cpp 대비 약 3배 빠르다고 정리했고, 5090 32GB 참고값(78~80 t/s)과도 비슷하거나 높다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.