AI Briefing

llama.cpp, MTP VRAM 절감 업데이트

b9410 MTP VRAM Save for F16 and FA llama.cpp

·2026.05.30 05:56

llama.cpp가 Flash Attention 사용 시 KQ 마스크를 f16으로 처리하여 VRAM 사용량을 줄이는 업데이트를 반영했다.

llama.cpp에서 Flash Attention(FA) 사용 시 KQ 마스크를 f32 대신 f16으로 예약하여 VRAM 효율을 높이는 업데이트가 적용되었다.

기존에는 FA를 사용하더라도 KQ 마스크를 f32로 예약한 뒤 백엔드에 전달할 때 f16으로 변환하는 구조였다. 이 과정에서 사용되지 않는 f32 마스크가 컴퓨트 버퍼를 점유하며 불필요한 VRAM을 소모하는 문제가 있었다.

이번 변경을 통해 MTP(Multi-Token Prediction) 환경에서 다음과 같은 VRAM 절감 효과를 기대할 수 있다:

  • -ub 2048 설정 시: 약 1.2GB 절감
  • -ub 512 설정 시: 약 300MB 절감

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.