AI Briefing

Qwen3.6-27B vLLM 도커, 118 TPS

Simple to use vLLM Docker Container for Qwen3.6 27b with Lorbus AutoRound INT4 quant and MTP speculative decoding - 118 tokens/second on 2x 3090s

·2026.04.27 22:19

Qwen3.6-27B를 vLLM Docker와 INT4·MTP 조합으로 2x 3090에서 초당 118토큰으로 구동했다.

2x RTX 3090에서 Qwen3.6-27BLorbus AutoRound INT4 양자화와 MTP speculative decoding으로 서빙하는 vLLM Docker 구성을 공개했다.

  • 성능: coding workload에서 118.13 tok/s, prose에서 88.98 tok/s를 측정했다.
  • 설정: TP=2, 200K context, fp8 KV cache, chunked prefill, num_speculative_tokens=3 조합을 사용했다.
  • 배포 방식: 모델은 실행 시 Hugging Face에서 내려받아 호스트 볼륨에 저장해, 컨테이너 업그레이드 시 재다운로드를 피한다.
  • 호환성: OpenAI-compatible API, MoonViT 기반 이미지 입력, 자동 GPU 감지, 단일/다중 GPU 실행 예시를 제공한다.
  • 운영 메모: PCIe 환경에서도 동작하며, NVLink는 필요 없다고 적었다.

다만 Qwen3.6의 하이브리드 어텐션에서 prefix caching은 실험적이고, spec-decode는 min_plogit_bias를 무시한다. CUDA graph mode도 spec-decode에서는 PIECEWISE로 내려간다고 명시했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.