AI Briefing

RTX 5090서 100 tps

Qwen3.6-27B-INT4 clocking 100 tps with 256k context length on 1x RTX 5090 via vllm 0.19

·2026.04.26 17:37

Qwen3.6-27B-INT4가 1x RTX 5090에서 256k 컨텍스트와 105~108 tps를 기록했다.

Qwen3.6-27B-INT41x RTX 5090에서 vllm 0.19로 구동해 105~108 tps를 기록했다. 네이티브 256k context를 유지한 상태에서 나온 수치다.

핵심은 경량화된 Lorbus/Qwen3.6-27B-int4-AutoRound 양자화 모델과 MTP 기반 speculative decoding이다. 작성자는 모델 크기가 작아져 별도 TQ 없이도 최대 컨텍스트 길이를 그대로 활용할 수 있다고 설명했다.

실행 설정은 다음과 같다.

  • --max-model-len 262144
  • --attention-backend flashinfer
  • --kv-cache-dtype fp8_e4m3
  • --max-num-seqs 2
  • --enable-prefix-caching
  • --enable-chunked-prefill
  • --speculative-config '{"method":"mtp","num_speculative_tokens":3}'

작성자는 이 구성이 전날보다 더 빠른 결과를 냈고, Qwen3.6-27B 계열의 로컬 추론 효율이 계속 개선되고 있다고 밝혔다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.