llama.cpp, Intel SYCL 지원 및 성능 개선
Recent llama.cpp updates for SYCL/Intel
·2026.07.15 17:52
llama.cpp가 Intel SYCL 환경에서 Flash Attention 지원 및 Qwen 모델 추론 속도 향상 업데이트를 반영했습니다.
llama.cpp의 SYCL/Intel 지원 기능이 대폭 강화되었습니다. 주요 업데이트 내용은 다음과 같습니다.
- Flash Attention 지원: oneDNN graph API(SDPA)를 통해 Xe2 아키텍처에서 XMX 엔진 기반의 Flash Attention을 지원합니다.
- Qwen 모델 성능 향상: Qwen3.6-27b-Q8_0 모델의 prefill 속도가 시퀀스 길이에 따라 **1.21배(p=512)**에서 최대 **4.26배(p=80k)**까지 향상되었습니다.
- 기타 최적화: USM 시스템 할당을 위한 최소 버퍼 크기 증가, OP XIELU 지원, conv2d_dw 커널의 fp16 지원 및 특정 양자화 방식(Q2_K, Q4_K, Q5_K)의 오류 수정이 포함되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.