llama.cpp, MTP 모델 VRAM 누수 수정
Latest b9274 Addresses MTP VRAM leak
·2026.05.22 07:43
핵심 내용
llama.cpp 최신 빌드에서 MTP 모델 사용 시 발생하는 VRAM 누수 문제가 해결되었습니다.
자세히 보기
llama.cpp의 최신 빌드인 b9274에서 MTP(Multi-Token Prediction) 모델 사용 시 발생하는 VRAM 누수(VRAM leak) 문제가 수정되었습니다.
기존 server_context_impl의 destroy() 함수는 메인 모델과 컨텍스트만 정리할 뿐, speculative decoder(spec), draft context(ctx_dft), draft model(model_dft) 등의 리소스를 제대로 해제하지 못하는 결함이 있었습니다.
이로 인해 서버가 절전(sleep) 및 재개(resume) 사이클을 반복할 때마다 기존 리소스가 해제되지 않은 채 새로운 리소스가 계속 할당되었으며, 이는 결국 VRAM 점유율 상승과 OOM(Out-of-Memory) 오류로 인한 서버 충돌로 이어졌습니다.
이번 업데이트를 통해 destroy() 호출 시 적절한 순서로 관련 리소스를 명시적으로 초기화하도록 수정되어 메모리 관리 안정성이 확보되었습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.