CPU 22토큰/초
Qwen 3.6 35B A3B Q4_K_M quant evaluation
·2026.04.18 19:01
핵심 내용
Q4_K_M Qwen 3.6 35B A3B가 CPU에서 22토큰/초로 동작했다.
자세히 보기
Qwen 3.6 35B A3B의 Q4_K_M GGUF 양자화 모델을 CPU 전용 환경에서 평가했다.
- 환경: 32 vCPU, 125GB RAM, GPU 없음
- 실행: llama-cpp-python / Unsloth GGUF
- 벤치마크: HumanEval, HellaSwag, BFCL
- 샘플 수: 1,264개
결과는 다음과 같다.
- HumanEval: 47.56%
- HellaSwag: 74.30%
- BFCL: 46.00%
속도는 초당 22토큰 수준이었고, commonsense reasoning에서 가장 좋은 성능을 보였다.
코드 생성과 function calling은 상대적으로 약해 40%대 중반에 머물렀지만, 활성 3B MoE 모델을 CPU에서 이 정도 속도로 돌릴 수 있다는 점이 핵심이다.
평가는 Neo AI Engineer가 적절한 양자화 버전과 채팅 템플릿을 찾고, 3개 벤치마크용 통합 eval harness를 구성해 수행했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.