Qwen 3.6 벤치
Qwen 3.6 35 UD 2 K_XL is pulling beyond its weight and quantization (No one is GPU Poor now)
·2026.04.17 21:41
핵심 내용
Qwen3.6-35B-A3B-UD-Q2_K_XL이 16GB VRAM 노트북에서 58회 툴콜을 98.3% 성공률로 처리했다.
자세히 보기
Qwen3.6-35B-A3B-UD-Q2_K_XL.gguf의 Q2_K_XL Unsloth 모델을 같은 논문 기반 웹앱 작업에 다시 적용했다.
llama.cpp의 llama-server를 16GB VRAM 노트북에서 돌렸고, -c 90000, -b 4096, --context-shift, enable_thinking=false, reasoning off 설정으로 대용량 문맥을 처리했다.
성과는 다음과 같다.
- tool calls 58회
- 성공률 98.3%
- 작업 중 처리한 토큰 수 약 270만 개
재현용으로는 statisticalplumber/research-webapp-skill 스킬을 그대로 사용할 수 있다고 안내했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.