llama.cpp, MTP VRAM 절감 업데이트
b9410 MTP VRAM Save for F16 and FA llama.cpp
·2026.05.30 05:56
핵심 내용
llama.cpp가 Flash Attention 사용 시 KQ 마스크를 f16으로 처리하여 VRAM 사용량을 줄이는 업데이트를 반영했다.
자세히 보기
llama.cpp에서 Flash Attention(FA) 사용 시 KQ 마스크를 f32 대신 f16으로 예약하여 VRAM 효율을 높이는 업데이트가 적용되었다.
기존에는 FA를 사용하더라도 KQ 마스크를 f32로 예약한 뒤 백엔드에 전달할 때 f16으로 변환하는 구조였다. 이 과정에서 사용되지 않는 f32 마스크가 컴퓨트 버퍼를 점유하며 불필요한 VRAM을 소모하는 문제가 있었다.
이번 변경을 통해 MTP(Multi-Token Prediction) 환경에서 다음과 같은 VRAM 절감 효과를 기대할 수 있다:
- -ub 2048 설정 시: 약 1.2GB 절감
- -ub 512 설정 시: 약 300MB 절감
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.