AI Briefing

Qwen3.6 35B 8GB 설정

Qwen3.6 35B MoE on 8GB VRAM — working llama-server config + a max_tokens / thinking trap I ran into

·2026.04.21 18:23

핵심 내용

RTX 4060 8GB VRAM에서 Qwen3.6-35B-A3B를 llama-server로 돌리는 설정과 thinking 예산 함정을 공유했다.

자세히 보기

RTX 4060 Laptop 8GB VRAM와 96GB RAM 환경에서 Qwen3.6-35B-A3B GGUF를 llama-server로 돌리는 설정을 공유했다.

  • 용도는 인터랙티브 채팅이 아니라 코딩 subagent다.
  • 실행값은 -ngl 99, --n-cpu-moe 99, -c 50000, -np 1, -fa on, --cache-type-k q8_0, --cache-type-v turbo2, --no-mmap, --mlock, --ctx-checkpoints 1, --cache-ram 0, --jinja, --reasoning on, --reasoning-budget -1, -b 2048, -ub 2048다.
  • PowerShell에서는 LLAMA_SET_ROWS=1과 LLAMA_CHAT_TEMPLATE_KWARGS의 preserve_thinking: true를 썼다.

실제로 막힌 원인은 크래시가 아니라 thinking이 max_tokens 예산을 전부 써버린 점이었다. thinking을 끄자 문제가 사라졌고, 요청별 thinking_budget_tokens를 쓰는 쪽이 더 낫다고 정리했다.

또 -b 2048 / -ub 2048는 2K 토큰 이상 프롬프트에서 기본값보다 prefill이 나았고, 8GB 환경에서 --n-cpu-moe 99로 MoE 레이어를 CPU에 더 많이 넘기는 구성이 현재 선택된 설정이다. 다만 최적의 n-cpu-moe 분할은 아직 열려 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.