RTX 5090서 100 tps
Qwen3.6-27B-INT4 clocking 100 tps with 256k context length on 1x RTX 5090 via vllm 0.19
·2026.04.26 17:37
Qwen3.6-27B-INT4가 1x RTX 5090에서 256k 컨텍스트와 105~108 tps를 기록했다.
Qwen3.6-27B-INT4를 1x RTX 5090에서 vllm 0.19로 구동해 105~108 tps를 기록했다. 네이티브 256k context를 유지한 상태에서 나온 수치다.
핵심은 경량화된 Lorbus/Qwen3.6-27B-int4-AutoRound 양자화 모델과 MTP 기반 speculative decoding이다. 작성자는 모델 크기가 작아져 별도 TQ 없이도 최대 컨텍스트 길이를 그대로 활용할 수 있다고 설명했다.
실행 설정은 다음과 같다.
--max-model-len 262144--attention-backend flashinfer--kv-cache-dtype fp8_e4m3--max-num-seqs 2--enable-prefix-caching--enable-chunked-prefill--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
작성자는 이 구성이 전날보다 더 빠른 결과를 냈고, Qwen3.6-27B 계열의 로컬 추론 효율이 계속 개선되고 있다고 밝혔다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.