Qwen3.6 35B 8GB 설정
Qwen3.6 35B MoE on 8GB VRAM — working llama-server config + a max_tokens / thinking trap I ran into
·2026.04.21 18:23
핵심 내용
RTX 4060 8GB VRAM에서 Qwen3.6-35B-A3B를 llama-server로 돌리는 설정과 thinking 예산 함정을 공유했다.
자세히 보기
RTX 4060 Laptop 8GB VRAM와 96GB RAM 환경에서 Qwen3.6-35B-A3B GGUF를 llama-server로 돌리는 설정을 공유했다.
- 용도는 인터랙티브 채팅이 아니라 코딩 subagent다.
- 실행값은
-ngl 99,--n-cpu-moe 99,-c 50000,-np 1,-fa on,--cache-type-k q8_0,--cache-type-v turbo2,--no-mmap,--mlock,--ctx-checkpoints 1,--cache-ram 0,--jinja,--reasoning on,--reasoning-budget -1,-b 2048,-ub 2048다. - PowerShell에서는
LLAMA_SET_ROWS=1과LLAMA_CHAT_TEMPLATE_KWARGS의preserve_thinking: true를 썼다.
실제로 막힌 원인은 크래시가 아니라 thinking이 max_tokens 예산을 전부 써버린 점이었다. thinking을 끄자 문제가 사라졌고, 요청별 thinking_budget_tokens를 쓰는 쪽이 더 낫다고 정리했다.
또 -b 2048 / -ub 2048는 2K 토큰 이상 프롬프트에서 기본값보다 prefill이 나았고, 8GB 환경에서 --n-cpu-moe 99로 MoE 레이어를 CPU에 더 많이 넘기는 구성이 현재 선택된 설정이다. 다만 최적의 n-cpu-moe 분할은 아직 열려 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.