AI Briefing

3090 2장 초가속

Qwen 3.6 + vLLM + Docker + 2x RTX 3090 setup, working great!

·2026.04.19 04:37

핵심 내용

2x RTX 3090에서 vLLM Docker로 Qwen3.6 35B 4bit를 멀티유저용으로 돌렸다.

자세히 보기

2x RTX 3090 서버에서 vLLM OpenAI Docker 이미지로 cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit를 올려 멀티유저 응답 성능을 개선했다.

구성은 다음과 같다.

  • tensor-parallel-size 2
  • max-model-len 65536
  • gpu-memory-utilization 0.85
  • enable-prefix-caching
  • reasoning-parser qwen3
  • enable-auto-tool-choice
  • tool-call-parser qwen3_coder
  • max-num-seqs 32
  • speculative-config: qwen3_next_mtp, speculative tokens 2

벤치마크에서는 pp2048 @ d2000이 5463.38 t/s ± 111.87, tg32 @ d2000이 103.13 t/s ± 22.06를 기록했다.

또 다른 테스트인 pp2048 @ d32768에서도 5178.25 t/s가 나와, 2장 3090 환경에서 35B급 양자화 모델을 높은 처리량으로 운용할 수 있음을 보여준다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.