AirLLM, 2.8T 모델 4GB VRAM 지원
AirLLM - Recent Updates - with Qwen3.8-27B, Kimi-K3 too
·2026.08.20 19:45
핵심 내용
AirLLM이 희소 MoE 모델 스트리밍으로 Kimi K3(2.8T)를 4GB VRAM에서 구동 가능하게 업데이트했다.
자세히 보기
AirLLM은 양자화나 증류 없이 추론 메모리 사용량을 극적으로 줄여, 70B LLM을 4GB GPU에서, Llama 3.1 405B를 8GB에서, DeepSeek-V3(671B)를 약 12GB에서 실행할 수 있게 한다. 특히 희소 MoE 모델은 레이어 전체가 아닌 토큰이 라우팅하는 전문가만 스트리밍하여, 현재까지 공개된 최대 규모 오픈소스 모델인 **Kimi K3(2.8T)**를 4GB 미만 VRAM에서 구동할 수 있게 했다.
주요 업데이트 내역
- 2026/08: Qwen3.8-27B 지원. Gated DeltaNet과 Gated Attention을 갖춘 신규 Dense VL 모델로, RTX 3090에서 3.33GB VRAM으로 측정됨. transformers 5.8+ 필요.
- 2026/07: Kimi K3(2.8T) 지원. RTX 6000 Ada에서 3.72GB VRAM으로 측정됨.
compressed-tensors,flash-attn, CUDA 12 기반 torch, transformers 4.56.x가 필수 요구사항임. - 2026/06: v3.0 릴리스. FP8 모델 지원 및 최신 모델 추가. DeepSeek-V3(671B)를 약 12GB, Qwen3-235B를 약 3GB에서 실행 가능.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.