llama.cpp, Intel Arc 성능 45% 향상
sycl : port multi-column MMVQ from CUDA backend (~45% speculative decoding speedup on Intel Arc) by masonmilby · Pull Request #21845 · ggml-org/llama.cpp
·2026.06.06 03:51
llama.cpp가 Intel Arc GPU를 위한 multi-column MMVQ 포팅을 통해 speculative decoding 속도를 약 45% 개선했습니다.
llama.cpp 프로젝트에 multi-column MMVQ를 CUDA 백엔드에서 SYCL로 포팅하는 업데이트가 반영되었습니다.
이 최적화를 통해 Intel Arc GPU 환경에서 speculative decoding 속도가 약 45% 향상되는 효과를 얻을 수 있습니다.
해당 성능 향상을 적용하려면 llama.cpp 버전을 b9519 이상으로 업데이트해야 합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.