AI Briefing

llama.cpp WebGPU 추론 성능 개선

ggml-webgpu: Improve prefill speeds for k-quants + refactor matmul for Q4/Q5/Q8 and k-quants by yomaytk · Pull Request #24225 · ggml-org/llama.cpp

·2026.06.09 11:41

llama.cpp의 ggml-webgpu 구현에서 k-quants 모델의 행렬 곱셈(matmul) 최적화를 통해 추론 속도를 대폭 향상시켰습니다.

llama.cpp 프로젝트의 ggml-webgpu 구현체에서 k-quants 양자화 모델의 prefill 속도를 개선하기 위한 업데이트가 진행되었습니다. 이번 PR은 Q4, Q5, Q8 및 k-quants 모델의 matmul(행렬 곱셈) 연산을 리팩토링하는 것을 골자로 합니다.

M2 Pro 환경에서의 벤치마크 결과, 모델에 따라 다음과 같은 성능 향상을 보였습니다:

  • Q2_K (Qwen3 0.6B): 기존 대비 2.44배 속도 향상
  • Q3_K (Qwen3 4B): 기존 대비 3.27배 속도 향상
  • Q4_K / Q5_K / Q6_K: 기존 대비 약 1.34배 ~ 1.52배 속도 향상

이번 최적화를 통해 WebGPU를 활용한 로컬 환경에서의 LLM 추론 성능이 크게 개선될 것으로 기대됩니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.