AI Briefing

llama.cpp, Hexagon NPU 실측

Running llama.cpp on Snapdragon Hexagon NPU seems promising

·2026.05.01 14:26

핵심 내용

OnePlus 12의 Snapdragon Hexagon NPU에서 llama.cpp가 모델에 따라 4.5~12.5 tok/s를 기록했다.

자세히 보기

OnePlus 12(Snapdragon 8 Gen 3)에서 llama.cpp의 Hexagon 백엔드를 Ubuntu에서 크로스컴파일해 Termux로 옮겨 실행했다.

  • gemma-3-12b-it-qat-Q4_0: pp(프롬프트 처리) 8 tok/s, tg(토큰 생성) 4.5 tok/s
  • gemma-3-4b-it-qat-Q4_0: pp(프롬프트 처리) 20 tok/s, tg(토큰 생성) 12.5 tok/s

속도는 Snapdragon 8 Gen 3 CPU와 비슷했고, 발열은 거의 없었다.

지원되는 GGUF 양자화 유형은 Q4_0, IQ4_NL, MXFP4, Q8_0, F32로 제한된다.

  • KV cache quantization은 아직 지원하지 않는다.
  • 모델과 KV cache가 4GB를 넘으면 GGML_HEXAGON_NDEV=2와 --device HTP0,HTP1를 써서 여러 NPU를 붙여야 한다.

예시 실행은 LD_LIBRARY_PATH=./lib:/vendor/lib64, ADSP_LIBRARY_PATH=./lib, GGML_HEXAGON_NDEV=2를 설정했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.