AI Briefing

3090 한 장 85TPS

An Overnight Stack for Qwen3.6–27B: 85 TPS, 125K Context, Vision — on One RTX 3090 | by Wasif Basharat | Apr, 2026

·2026.04.23 23:11

RTX 3090 한 장으로 Qwen3.6-27B를 85 TPS, 125K context로 구동했다.

Qwen3.6-27BRTX 3090 24GB 한 장에서 돌리기 위해 양자화, speculative decoding, KV cache 압축을 단계적으로 맞췄다.

  • 기본 AWQ INT4에서는 38 TPS / 8K context / 21.4GB VRAM 수준이었고,
  • MTP head가 없는 양자화본은 vLLM이 BF16 MTP head 2.37GB를 새로 잡으면서 24GB에서 OOM이 났다.
  • Lorbus/Qwen3.6-27B-int4-AutoRoundmtp.fcBF16으로 남겨 vLLM이 MTP를 정상 로드하게 했고, 54.6 TPS(narr) / 59.0 TPS(code), 평균 accept length 1.9를 기록했다.
  • speculative token 수를 늘려보니 n=3에서 효율이 가장 좋았고, 63.8 TPS(narr) / 79.7 TPS(code), AL 3.4까지 올랐다.
  • FP8 KV cache로는 20K context까지 확장됐고, TPS 손실은 거의 없었다.

그 다음 병목은 TurboQuant KV cache였다. hybrid attention + DeltaNet 구조 때문에 vLLM이 기본적으로 이를 막았고, 외부 패치 묶음인 genesis-vllm-patches를 적용해 하이브리드 게이트를 우회했다.

이후 TurboQuant k8v4 설정에서 KV pool이 크게 늘었지만, warmup 단계의 CUDA graph capture에서 query_start_loc.tolist()가 문제를 일으켜 크래시가 났다. 대응으로 CUDA graph를 비활성화해야 했고, 최종적으로 85 TPS sustained / 106 TPS peak, 125K context, Vision enabled, 21.3 / 24GB VRAM, 230W cap 구성이 정리됐다.

추가로, 초반 GGUF 파일은 aria2c 다운로드 중 손상돼 있었고, SHA256과 HF linked-etag 검증으로 재다운로드한 뒤에야 모델이 정상 동작했다는 점도 핵심 교훈으로 제시됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.