llama.cpp, 동적 모델 관리 기능 도입
New in llama.cpp: Model Management
·2025.12.12 00:47
핵심 내용
llama.cpp 서버에 여러 모델을 재시작 없이 동적으로 로드 및 교체할 수 있는 라우터 모드가 추가되었다.
자세히 보기
llama.cpp 서버에 **라우터 모드(router mode)**가 도입되어, 서버를 재시작하지 않고도 여러 모델을 동적으로 로드, 언로드 및 전환할 수 있게 되었다. 이 기능은 각 모델을 별도의 프로세스에서 실행하는 멀티 프로세스 아키텍처를 사용하여, 특정 모델이 충돌하더라도 다른 모델에 영향을 주지 않는다.
주요 기능은 다음과 같다:
- 자동 검색(Auto-discovery):
llama.cpp캐시 또는 지정된 디렉토리에서 GGUF 파일을 자동으로 찾아낸다. - 온디맨드 로딩(On-demand loading): 모델이 처음 요청될 때 자동으로 메모리에 로드된다.
- LRU 교체(LRU eviction): 설정된 최대 모델 수(
--models-max)를 초과하면 가장 오랫동안 사용되지 않은 모델을 자동으로 언로드하여 VRAM을 확보한다. - 요청 라우팅(Request routing): API 요청의
model필드를 기반으로 적절한 모델로 요청을 전달한다.
사용자는 HTTP API를 통해 모델을 수동으로 로드하거나 언로드할 수 있으며, 내장된 Web UI에서도 드롭다운 메뉴를 통해 간편하게 모델을 전환할 수 있다. 또한, 프리셋(presets) 기능을 통해 모델별로 컨텍스트 크기나 템퍼러처(temperature) 등의 설정을 다르게 지정할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.