ARM 로컬 추론 속도
tok/s on ASUS Zenbook A16 (Snapdragon X2)
·2026.04.19 05:00
핵심 내용
Snapdragon X2 Elite Extreme 탑재 Zenbook A16의 llama.cpp 토큰 속도 측정치.
자세히 보기
ASUS Zenbook A16에서 Snapdragon X2 Elite Extreme (X2E94100, Qualcomm Oryon Gen 3) 기준으로 llama.cpp 토큰 속도를 측정했다.
- 18코어 CPU, 48GB unified memory, 약 228GB/s 대역폭
- ISA: NEON, FMA, DOTPROD, I8MM, SVE/SVE2, SME/SME2, fp16 지원, 4096-bit Matrix Engine(SME2) 확인
- KleidiAI(SME2) 는 Windows 환경에서 동작하지 않은 것으로 보였고, Adreno GPU도 시도했지만 출력이 나오지 않아 CPU-only로 테스트
성능은 Q4_K_M 기준으로 비교했다.
- Qwen3-4B: 248 t/s(PP512), 42 t/s(TG128)
- Gemma-4-31B-it: 39 t/s(PP512), 6.5 t/s(TG128)
- Gemma-4-26B-A4B-it: 168 t/s(PP512), 31 t/s(TG128)
- Qwen3.6-35B-A3B: 171 t/s(PP512), 33 t/s(TG128)
같은 Qwen3.6-35B-A3B에서 양자화와 런타임 설정을 바꾸면:
- Q4_K_M: 171 / 33.0 t/s
- Q5_K_M: 153 / 30.4 t/s
- Q5_K_M + q8_0 KV + FA(opencode): 145 / 29.6 t/s
작성자는 Q5 Qwen3.6를 opencode에서 꽤 쓸 만하다고 평가했고, 배터리 상태에서도 로컬 실행이 가능하다고 밝혔다. 다음 실험 목표는 Whisper 모델을 NPU 100%로 구동하는 것이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.