llama.cpp, MTP 모델 VRAM 누수 수정
Latest b9274 Addresses MTP VRAM leak
·2026.05.22 07:43
llama.cpp 최신 빌드에서 MTP 모델 사용 시 발생하는 VRAM 누수 문제가 해결되었습니다.
llama.cpp의 최신 빌드인 b9274에서 MTP(Multi-Token Prediction) 모델 사용 시 발생하는 VRAM 누수(VRAM leak) 문제가 수정되었습니다.
기존 server_context_impl의 destroy() 함수는 메인 모델과 컨텍스트만 정리할 뿐, speculative decoder(spec), draft context(ctx_dft), draft model(model_dft) 등의 리소스를 제대로 해제하지 못하는 결함이 있었습니다.
이로 인해 서버가 절전(sleep) 및 재개(resume) 사이클을 반복할 때마다 기존 리소스가 해제되지 않은 채 새로운 리소스가 계속 할당되었으며, 이는 결국 VRAM 점유율 상승과 OOM(Out-of-Memory) 오류로 인한 서버 충돌로 이어졌습니다.
이번 업데이트를 통해 destroy() 호출 시 적절한 순서로 관련 리소스를 명시적으로 초기화하도록 수정되어 메모리 관리 안정성이 확보되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.