AI Briefing

VRAM 한계 돌파

Llama.cpp's auto fit works much better than I expected

·2026.04.22 03:07

핵심 내용

32GB VRAM에서도 llama.cpp `--fit`로 Qwen3.6 Q8을 256k 컨텍스트에 57 t/s로 구동했다.

자세히 보기

32GB VRAM 환경에서 **llama.cpp --fit**를 켜면, 가중치가 VRAM보다 큰 모델도 꽤 높은 속도로 돌릴 수 있다.

  • 테스트 모델: Qwen3.6 Q8
  • 컨텍스트: 256k
  • 실행 옵션: --fit
  • 하드웨어: 32GB VRAM, 5090, Oculink 연결
  • 결과: 57 t/s

작성자는 기존에 "VRAM에 다 안 들어가면 2 t/s 수준"이라고 생각했지만, 실제로는 그보다 훨씬 나은 성능이 나왔다고 밝혔다. VRAM에 모델 전체가 완전히 들어가지 않아도, --fit를 활용하면 대형 모델을 실사용 가능한 속도로 돌리는 데 도움이 된다는 점을 보여준다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.