AI Briefing

Qwen3.6-27B, Windows서 72 tok/s

Qwen3.6-27B at 72 tok/s on RTX 3090 on Windows using native vLLM (no WSL, no Docker), portable launcher and installer

·2026.05.02 17:12

핵심 내용

Windows 10에서 native vLLM으로 Qwen3.6-27B가 72 tok/s를 기록했다.

자세히 보기

Windows 10에서 패치된 native vLLM으로 Qwen3.6-27B를 구동해 WSL·Docker 없이 실행했고, RTX 3090 기준 72 tok/s를 제시했다.

  • 짧은 프롬프트: 72 tok/s
  • 긴 프롬프트(약 25k tokens): 64.5 tok/s
  • 127k ctx 단일 GPU: 53.4 tok/s
  • PP=2 / 2×3090: 160k ctx

배포물은 GitHub 릴리스의 포터블 ZIP으로 제공되며, 관리자 권한·pip·Python 없이 압축 해제 후 start.bat만 실행하면 된다. 첫 실행 때는 번들된 vLLM wheel과 의존성을 내장 Python에 설치하고, 필요하면 Lorbus AutoRound INT4 양자화를 Hugging Face에서 자동 내려받는다.

테스트는 Windows 10 + 2×RTX 3090에서 진행됐고, 작성자는 Ampere/Ada/Blackwell 계열 카드에서 동작할 것으로 봤다. OpenAI-compatible endpoint는 http://127.0.0.1:5001/v1다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.