AI Briefing

Qwen3.6-27B, Windows서 72 tok/s

Qwen3.6-27B at 72 tok/s on RTX 3090 on Windows using native vLLM (no WSL, no Docker), portable launcher and installer

·2026.05.02 17:12

Windows 10에서 native vLLM으로 Qwen3.6-27B가 72 tok/s를 기록했다.

Windows 10에서 패치된 native vLLM으로 Qwen3.6-27B를 구동해 WSL·Docker 없이 실행했고, RTX 3090 기준 72 tok/s를 제시했다.

  • 짧은 프롬프트: 72 tok/s
  • 긴 프롬프트(약 25k tokens): 64.5 tok/s
  • 127k ctx 단일 GPU: 53.4 tok/s
  • PP=2 / 2×3090: 160k ctx

배포물은 GitHub 릴리스의 포터블 ZIP으로 제공되며, 관리자 권한·pip·Python 없이 압축 해제 후 start.bat만 실행하면 된다. 첫 실행 때는 번들된 vLLM wheel과 의존성을 내장 Python에 설치하고, 필요하면 Lorbus AutoRound INT4 양자화를 Hugging Face에서 자동 내려받는다.

테스트는 Windows 10 + 2×RTX 3090에서 진행됐고, 작성자는 Ampere/Ada/Blackwell 계열 카드에서 동작할 것으로 봤다. OpenAI-compatible endpoint는 http://127.0.0.1:5001/v1다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.