AI Briefing

llama.cpp, MTP 모델 VRAM 누수 수정

Latest b9274 Addresses MTP VRAM leak

·2026.05.22 07:43

핵심 내용

llama.cpp 최신 빌드에서 MTP 모델 사용 시 발생하는 VRAM 누수 문제가 해결되었습니다.

자세히 보기

llama.cpp의 최신 빌드인 b9274에서 MTP(Multi-Token Prediction) 모델 사용 시 발생하는 VRAM 누수(VRAM leak) 문제가 수정되었습니다.

기존 server_context_impl의 destroy() 함수는 메인 모델과 컨텍스트만 정리할 뿐, speculative decoder(spec), draft context(ctx_dft), draft model(model_dft) 등의 리소스를 제대로 해제하지 못하는 결함이 있었습니다.

이로 인해 서버가 절전(sleep) 및 재개(resume) 사이클을 반복할 때마다 기존 리소스가 해제되지 않은 채 새로운 리소스가 계속 할당되었으며, 이는 결국 VRAM 점유율 상승과 OOM(Out-of-Memory) 오류로 인한 서버 충돌로 이어졌습니다.

이번 업데이트를 통해 destroy() 호출 시 적절한 순서로 관련 리소스를 명시적으로 초기화하도록 수정되어 메모리 관리 안정성이 확보되었습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.