llama.cpp 멀티 GPU KV 캐시 오류 수정
ICYM: llama.cpp b9455 --SM Tensor KV Cache Fix is MERGED
·2026.06.02 05:08
llama.cpp가 멀티 GPU 환경에서 --sm tensor 사용 시 KV 캐시 양자화가 작동하지 않던 문제를 해결했습니다.
llama.cpp의 최신 업데이트(b9455)에서 멀티 GPU 환경의 --sm tensor 옵션 사용 시 **양자화된 KV 캐시(quantized KV cache)**가 제대로 작동하지 않던 문제가 해결되었습니다.
기존에는 KV 캐시 회전을 위해 텐서를 평탄화(flattening)하는 과정에서 형태 정보(shape information)가 손실되어 meta backend가 이를 처리하지 못하는 결함이 있었습니다. 이를 해결하기 위해 텐서 형태를 직접 바꾸는 대신, ggml_backend_meta_split_state 사양을 확장하여 데이터 레이아웃 정보를 유지하는 방식을 채택했습니다.
이번 수정으로 별도의 계산 그래프(compute graph) 변경 없이도 멀티 GPU 환경에서 효율적인 KV 캐시 양자화 활용이 가능해졌습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.