VRAM 한계 돌파
Llama.cpp's auto fit works much better than I expected
·2026.04.22 03:07
핵심 내용
32GB VRAM에서도 llama.cpp `--fit`로 Qwen3.6 Q8을 256k 컨텍스트에 57 t/s로 구동했다.
자세히 보기
32GB VRAM 환경에서 **llama.cpp --fit**를 켜면, 가중치가 VRAM보다 큰 모델도 꽤 높은 속도로 돌릴 수 있다.
- 테스트 모델: Qwen3.6 Q8
- 컨텍스트: 256k
- 실행 옵션:
--fit - 하드웨어: 32GB VRAM, 5090, Oculink 연결
- 결과: 57 t/s
작성자는 기존에 "VRAM에 다 안 들어가면 2 t/s 수준"이라고 생각했지만, 실제로는 그보다 훨씬 나은 성능이 나왔다고 밝혔다. VRAM에 모델 전체가 완전히 들어가지 않아도, --fit를 활용하면 대형 모델을 실사용 가능한 속도로 돌리는 데 도움이 된다는 점을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.