AI Briefing

Qwen3.6 64K 실측

Qwen3.6 35B-A3B GGUF Q4_K_S em RTX 5070 12GB — teste real com 64K context + thinking

·2026.04.23 14:15

RTX 5070 12GB에서 Qwen3.6-35B-A3B가 64K context로 구동됐다.

RTX 5070 12GB에서 Qwen3.6-35B-A3B UD Q4_K_S GGUF를 llama.cpp OpenAI-compatible 서버로 돌린 결과, 64K context + thinking 구성이 실제로 동작했다.

모델 파일은 19.45 GiB, 총 파라미터는 34.66B, 활성 파라미터는 A3B였고, MoE 구조에서 256 experts 중 토큰당 8 experts가 사용됐다.

메모리 사용량은 대략 다음 수준이었다.

  • CUDA model buffer:9.46 GiB
  • CPU mapped model buffer:11.32 GiB
  • KV cache 64K:465 MiB
  • Compute buffer CUDA:1.97 GiB

성능은 구간별 차이가 컸다.

  • 10K~20K prompt: prompt eval 1,420~1,480 tok/s, generation 41~47 tok/s
  • ~30K context: generation 39~43 tok/s로 여전히 실사용 가능
  • ~40K context 이상: generation이 12~14 tok/s까지 떨어지고 긴 응답이 무거워짐

또한 forcing full prompt re-processing due to lack of cache data 메시지가 반복되며, 큰 프롬프트 변화 시 캐시 재활용이 잘 안 되는 경우가 있었다.

정리하면 16K~32K가 가장 좋은 체감 구간이고, 64K는 가능하지만 속도 목적의 기본 프리셋으로 쓰기엔 무겁다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.