airllm: 4GB VRAM에서 2.8T Kimi K3 구동
lyogavin/airllm
프로젝트 소개
기존 방식과 달리 양자화나 증류, 가지치기 없이도 추론 시 메모리 사용량을 대폭 줄여준다. 70B 규모의 LLM을 단 하나의 4GB GPU 카드에서 실행할 수 있으며, 405B Llama 3.1은 8GB, 671B DeepSeek-V3는 약 12GB 환경에서 구동된다. 특히 2.8T 규모의 Kimi K3와 같은 대규모 MoE 모델은 4GB 미만의 VRAM에서도 동작한다.
메모리 효율의 핵심은 레이어별 스트리밍과 전문가 단위 로딩에 있다. 전체 레이어를 한 번에 로드하지 않고 필요한 부분만 순차적으로 불러오며, MoE 모델의 경우 토큰이 실제로 라우팅되는 전문가만 로드한다. 또한 블록 단위 양자화를 적용하면 추론 속도가 최대 3배까지 빨라지며, 정확도 손실은 거의 없다.

Qwen3, Llama 3.x/4, DeepSeek V2/V3, Phi-4, Gemma 등 최신 모델들을 단일 AutoModel 인터페이스로 지원한다. 27B 규모의 Qwen3.8-27B는 3.33GB VRAM에서, 235B Qwen3는 약 3GB에서 실행된다. macOS(Apple Silicon)와 CPU 추론도 지원하며, Hugging Face 모델 ID만 입력하면 자동으로 모델 유형을 감지하고 초기화한다.
고사양 GPU가 없는 환경에서 대규모 모델을 실험하거나 프로토타이핑할 때 유용하다. 디스크 공간이 부족할 경우 원본 모델을 삭제하고 변환된 모델만 유지하도록 설정할 수 있어 저장 공간을 절반으로 줄일 수 있다. Apache-2.0 라이선스로 공개되어 있어 상업적 프로젝트에도 자유롭게 활용할 수 있다.
lyogavin/airllm
AirLLM 70B inference with single 4GB GPU
Jupyter Notebook
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.