AI Briefing

Qwen3.6-27B vLLM 도커, 118 TPS

Simple to use vLLM Docker Container for Qwen3.6 27b with Lorbus AutoRound INT4 quant and MTP speculative decoding - 118 tokens/second on 2x 3090s

·2026.04.27 22:19

핵심 내용

Qwen3.6-27B를 vLLM Docker와 INT4·MTP 조합으로 2x 3090에서 초당 118토큰으로 구동했다.

자세히 보기

2x RTX 3090에서 Qwen3.6-27B를 Lorbus AutoRound INT4 양자화와 MTP speculative decoding으로 서빙하는 vLLM Docker 구성을 공개했다.

  • 성능: coding workload에서 118.13 tok/s, prose에서 88.98 tok/s를 측정했다.
  • 설정: TP=2, 200K context, fp8 KV cache, chunked prefill, num_speculative_tokens=3 조합을 사용했다.
  • 배포 방식: 모델은 실행 시 Hugging Face에서 내려받아 호스트 볼륨에 저장해, 컨테이너 업그레이드 시 재다운로드를 피한다.
  • 호환성: OpenAI-compatible API, MoonViT 기반 이미지 입력, 자동 GPU 감지, 단일/다중 GPU 실행 예시를 제공한다.
  • 운영 메모: PCIe 환경에서도 동작하며, NVLink는 필요 없다고 적었다.

다만 Qwen3.6의 하이브리드 어텐션에서 prefix caching은 실험적이고, spec-decode는 min_p와 logit_bias를 무시한다. CUDA graph mode도 spec-decode에서는 PIECEWISE로 내려간다고 명시했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.