llama.cpp, sm-tensor 성능 최적화 패치
llama.cpp b9966 for sm-tensor
·2026.07.12 08:28
llama.cpp의 sm-tensor 사용 시 발생하는 불필요한 정규식 재컴파일 문제를 해결하여 디코드 성능을 개선했습니다.
llama.cpp b9966 버전에서 sm-tensor를 사용하는 환경을 위한 성능 최적화 패치가 적용되었습니다.
기존 코드에서는 디코드 스레드에서 매 토큰마다, 그리고 매 텐서마다 29개의 정규식(regex) 패턴을 매번 새로 컴파일하는 비효율적인 구조를 가지고 있었습니다.
이번 업데이트를 통해 해당 정규식 패턴들을 **캐싱(Caching)**하여 재사용하도록 수정되었으며, 이를 통해 디코드 스레드에서 낭비되는 CPU 자원을 크게 줄이고 추론 효율을 높였습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.