AI Briefing

llama.cpp, MTP 텐서 기본 로드 변경

PSA: llama.cpp now loads MTP tensors by default for any draft-mtp arch, even with MTP disabled

·2026.07.30 03:45

llama.cpp가 MTP 비활성화 상태에서도 특정 아키텍처의 MTP 텐서를 기본 로드하도록 변경되어 VRAM 사용량이 증가합니다.

최근 llama.cpp 업데이트에 따라, --spec-type draft-mtp 옵션을 명시적으로 전달하지 않더라도 draft-mtp 아키텍처를 가진 모델(GLM-5.2, hy_v3, qwen35moe, step35 등)의 GGUF 파일에 MTP/NextN 텐서가 포함되어 있다면 이를 기본적으로 로드합니다.

이전 버전에서는 투기적 디코딩(Speculative Decoding)을 활성화할 때만 해당 텐서를 로드했으나, 이제는 모델 로드 시 자동으로 포함됩니다. 이로 인해 MTP 기능을 사용하지 않더라도 추가적인 VRAM/RAM 점유(약 1개의 MoE 레이어 분량)가 발생할 수 있으므로, 메모리 자원이 제한적인 환경에서는 주의가 필요합니다.

관련 변경 사항은 GitHub Pull Request #2598에서 확인할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.