AI Briefing

CPU 22토큰/초

Qwen 3.6 35B A3B Q4_K_M quant evaluation

·2026.04.18 19:01

핵심 내용

Q4_K_M Qwen 3.6 35B A3B가 CPU에서 22토큰/초로 동작했다.

자세히 보기

Qwen 3.6 35B A3B의 Q4_K_M GGUF 양자화 모델을 CPU 전용 환경에서 평가했다.

  • 환경: 32 vCPU, 125GB RAM, GPU 없음
  • 실행: llama-cpp-python / Unsloth GGUF
  • 벤치마크: HumanEval, HellaSwag, BFCL
  • 샘플 수: 1,264개

결과는 다음과 같다.

  • HumanEval: 47.56%
  • HellaSwag: 74.30%
  • BFCL: 46.00%

속도는 초당 22토큰 수준이었고, commonsense reasoning에서 가장 좋은 성능을 보였다.

코드 생성과 function calling은 상대적으로 약해 40%대 중반에 머물렀지만, 활성 3B MoE 모델을 CPU에서 이 정도 속도로 돌릴 수 있다는 점이 핵심이다.

평가는 Neo AI Engineer가 적절한 양자화 버전과 채팅 템플릿을 찾고, 3개 벤치마크용 통합 eval harness를 구성해 수행했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.