8GB VRAM으로 122B MoE 로컬 추론
122B MoE local inference with 8 GB GPU VRAM by keeping experts on CPU
·2026.06.04 03:44
전문가를 CPU에 배치하여 8GB VRAM 환경에서도 122B MoE 모델을 구동하는 InstinctRazor 기술이 공개되었다.
InstinctRazor-Qwen3.5-122B-A10B는 전문가(Experts)를 CPU에 유지함으로써 GPU VRAM 요구 사항을 획기적으로 낮춘 122B MoE(Mixture of Experts) 모델 및 런타임 설정이다.
이 방식을 통해 사용자는 8GB 수준의 소비자용 GPU VRAM만으로도 대규모 모델을 로컬에서 추론할 수 있다. 전체 압축 모델 크기는 약 50GB이다.
주요 벤치마크 성능 (Gemma-4-A4B 대비):
- 우세: MMLU-Pro, GPQA-Diamond, MMMLU, HLE, LiveCodeBench
- 열세: MATH-500, AIME
해당 프로젝트는 메모리 사용량과 실행 시간 사이의 트레이드오프(tradeoff)를 최적화하는 데 중점을 두고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.