AI Briefing

ARM 로컬 추론 속도

tok/s on ASUS Zenbook A16 (Snapdragon X2)

·2026.04.19 05:00

핵심 내용

Snapdragon X2 Elite Extreme 탑재 Zenbook A16의 llama.cpp 토큰 속도 측정치.

자세히 보기

ASUS Zenbook A16에서 Snapdragon X2 Elite Extreme (X2E94100, Qualcomm Oryon Gen 3) 기준으로 llama.cpp 토큰 속도를 측정했다.

  • 18코어 CPU, 48GB unified memory, 약 228GB/s 대역폭
  • ISA: NEON, FMA, DOTPROD, I8MM, SVE/SVE2, SME/SME2, fp16 지원, 4096-bit Matrix Engine(SME2) 확인
  • KleidiAI(SME2) 는 Windows 환경에서 동작하지 않은 것으로 보였고, Adreno GPU도 시도했지만 출력이 나오지 않아 CPU-only로 테스트

성능은 Q4_K_M 기준으로 비교했다.

  • Qwen3-4B: 248 t/s(PP512), 42 t/s(TG128)
  • Gemma-4-31B-it: 39 t/s(PP512), 6.5 t/s(TG128)
  • Gemma-4-26B-A4B-it: 168 t/s(PP512), 31 t/s(TG128)
  • Qwen3.6-35B-A3B: 171 t/s(PP512), 33 t/s(TG128)

같은 Qwen3.6-35B-A3B에서 양자화와 런타임 설정을 바꾸면:

  • Q4_K_M: 171 / 33.0 t/s
  • Q5_K_M: 153 / 30.4 t/s
  • Q5_K_M + q8_0 KV + FA(opencode): 145 / 29.6 t/s

작성자는 Q5 Qwen3.6를 opencode에서 꽤 쓸 만하다고 평가했고, 배터리 상태에서도 로컬 실행이 가능하다고 밝혔다. 다음 실험 목표는 Whisper 모델을 NPU 100%로 구동하는 것이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.