llama.cpp, Intel Arc 성능 45% 향상
sycl : port multi-column MMVQ from CUDA backend (~45% speculative decoding speedup on Intel Arc) by masonmilby · Pull Request #21845 · ggml-org/llama.cpp
·2026.06.06 03:51
핵심 내용
llama.cpp가 Intel Arc GPU를 위한 multi-column MMVQ 포팅을 통해 speculative decoding 속도를 약 45% 개선했습니다.
자세히 보기
llama.cpp 프로젝트에 multi-column MMVQ를 CUDA 백엔드에서 SYCL로 포팅하는 업데이트가 반영되었습니다.
이 최적화를 통해 Intel Arc GPU 환경에서 speculative decoding 속도가 약 45% 향상되는 효과를 얻을 수 있습니다.
해당 성능 향상을 적용하려면 llama.cpp 버전을 b9519 이상으로 업데이트해야 합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.