3090 2장 초가속
Qwen 3.6 + vLLM + Docker + 2x RTX 3090 setup, working great!
·2026.04.19 04:37
핵심 내용
2x RTX 3090에서 vLLM Docker로 Qwen3.6 35B 4bit를 멀티유저용으로 돌렸다.
자세히 보기
2x RTX 3090 서버에서 vLLM OpenAI Docker 이미지로 cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit를 올려 멀티유저 응답 성능을 개선했다.
구성은 다음과 같다.
tensor-parallel-size 2max-model-len 65536gpu-memory-utilization 0.85enable-prefix-cachingreasoning-parser qwen3enable-auto-tool-choicetool-call-parser qwen3_codermax-num-seqs 32speculative-config:qwen3_next_mtp, speculative tokens 2
벤치마크에서는 pp2048 @ d2000이 5463.38 t/s ± 111.87, tg32 @ d2000이 103.13 t/s ± 22.06를 기록했다.
또 다른 테스트인 pp2048 @ d32768에서도 5178.25 t/s가 나와, 2장 3090 환경에서 35B급 양자화 모델을 높은 처리량으로 운용할 수 있음을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.