llama.cpp, Hexagon NPU 실측
Running llama.cpp on Snapdragon Hexagon NPU seems promising
·2026.05.01 14:26
핵심 내용
OnePlus 12의 Snapdragon Hexagon NPU에서 llama.cpp가 모델에 따라 4.5~12.5 tok/s를 기록했다.
자세히 보기
OnePlus 12(Snapdragon 8 Gen 3)에서 llama.cpp의 Hexagon 백엔드를 Ubuntu에서 크로스컴파일해 Termux로 옮겨 실행했다.
gemma-3-12b-it-qat-Q4_0: pp(프롬프트 처리) 8 tok/s, tg(토큰 생성) 4.5 tok/sgemma-3-4b-it-qat-Q4_0: pp(프롬프트 처리) 20 tok/s, tg(토큰 생성) 12.5 tok/s
속도는 Snapdragon 8 Gen 3 CPU와 비슷했고, 발열은 거의 없었다.
지원되는 GGUF 양자화 유형은 Q4_0, IQ4_NL, MXFP4, Q8_0, F32로 제한된다.
- KV cache quantization은 아직 지원하지 않는다.
- 모델과 KV cache가 4GB를 넘으면
GGML_HEXAGON_NDEV=2와--device HTP0,HTP1를 써서 여러 NPU를 붙여야 한다.
예시 실행은 LD_LIBRARY_PATH=./lib:/vendor/lib64, ADSP_LIBRARY_PATH=./lib, GGML_HEXAGON_NDEV=2를 설정했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.