RTX 3090서 Qwen 35B MoE
Qwen 3.6 35B MoE at full 262K context on an RTX 3090. Here's exactly how I did it.
·2026.05.04 07:21
RTX 3090에서 Qwen 3.6 35B MoE를 262K context로 돌리는 재현 가능한 세팅을 공개했다.
Windows 기준으로 RTX 3090 24GB와 64GB RAM에서 Qwen 3.6 35B MoE를 돌려 12.4GB VRAM에 모델을 올리고 262K context를 유지하는 절차를 정리했다. 저자는 이 조합이 약 111 tok/s를 낸다고 적었다.
핵심은 llama.cpp-tq3 포크와 TurboQuant다. 일반 GGUF보다 가중치와 KV cache를 더 효율적으로 압축해 메모리 부담을 줄이고, MoE와 DeltaNet + Gated Attention이 긴 컨텍스트에서의 성능 저하를 완화한다고 설명한다. 40층 중 10개 attention layer만 캐시를 키우기 때문에 dense 모델보다 KV cache가 훨씬 작다.
설치는 다음 순서로 진행한다.
- Windows에서 Git, CMake, Ninja, Visual Studio 2022 Build Tools, CUDA Toolkit를 준비한다.
conda create -n qwen-local python=3.11 -y후huggingface_hub[cli]를 설치한다.- Hugging Face에서
Qwen3.6-35B-A3B-TQ3_4S.gguf와mmproj-BF16.gguf를 내려받고,mmproj로 비전 지원을 붙인다. llama.cpp-tq3를 CUDA 활성화 옵션으로 빌드한다..bat에서CONTEXT=262144,KEY_TYPE=q8_0,VAL_TYPE=q8_0,BATCH_SIZE=2048,REASONING=on을 두고-fa on,--jinja,--reasoning,--reasoning-budget 2048을 붙여llama-server.exe를 실행한다.
기본 권장은 **q8_0/q8_0**이며, 이 설정에서 262K context가 약 2.7GB만 쓴다고 적었다. tq3_0이나 q4_0으로 더 줄일 수 있지만, 서버 설정은 실행 중 변경되지 않으므로 값을 바꾸면 재시작해야 한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.