AI Briefing

Ollama VRAM 부족, 기본 설정이 원인

Your model fits. Your settings don't. Three Ollama defaults multiply your memory before the model ever loads.

·2026.08.26 17:41

핵심 내용

Ollama의 기본 컨텍스트 길이, 병렬 요청 수, 상주 모델 제한 설정이 메모리 사용량을 급증시켜 GPU 오프로드 실패의 주된 원인이 된다.

자세히 보기

Ollama에서 모델이 GPU에 완전히 로드되지 않고 CPU로 오프로드되는 현상은 모델 자체의 문제보다 **기본 설정(Default)**에 기인하는 경우가 많다. ollama ps 명령어로 PROCESSOR 상태를 확인하여 100% GPU가 아닌 경우, 아래 세 가지 기본 설정을 점검해야 한다.

1. 예상보다 작은 컨텍스트 윈도우

Ollama의 기본 컨텍스트 길이는 4096 토큰이다. 사용자가 128k 모델이라고 해도 별도로 num_ctx를 설정하지 않으면 4096 토큰만 사용된다. 프롬프트가 이 범위를 초과하면 앞부분이 잘려 나가며, 이는 모델 성능 저하가 아니라 입력이 윈도우에 들어가지 못한 결과다.

2. 병렬 요청에 따른 메모리 배증

메모리 요구량은 OLLAMA_CONTEXT_LENGTH × OLLAMA_MAX_PARALLEL_REQUESTS로 계산된다. 기본 병렬 요청 수가 1 이상일 때 컨텍스트 길이를 늘리면 메모리 사용량이 곱셈으로 증가한다. 예를 들어 2K 컨텍스트에 병렬 요청 4개를 설정하면 8K 컨텍스트에 해당하는 메모리가 할당되어 VRAM 부족으로 이어질 수 있다.

3. 사용하지 않는 모델의 VRAM 상주

OLLAMA_MAX_LOADED_MODELS 기본값은 GPU 수의 3배(또는 CPU 추론 시 3)이며, 마지막 사용 후 5분간 모델이 VRAM에 상주한다. 이로 인해 오전에는 정상 동작하던 환경이 오후에는 다른 모델의 잔여 메모리 때문에 스파일링(spilling)이 발생할 수 있다. ollama stop을 통해 즉시 메모리를 해제할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.