colibri: 소비자용 PC에서 744B MoE 실행
colibri: 744B MoE 모델을 25GB RAM 소비자 PC에서 실행하는 순수 C 추론 엔진
·2026.07.14 15:30
대규모 MoE 모델의 가중치를 디스크에 두고 필요한 부분만 스트리밍하여 저사양 PC에서도 실행 가능한 C 기반 추론 엔진이 공개되었습니다.
colibri는 744B 파라미터 규모의 MoE(Mixture-of-Experts) 모델을 약 25GB RAM을 가진 일반 소비자용 PC에서 구동할 수 있도록 설계된 순수 C 기반 추론 엔진입니다.
핵심 메커니즘은 모델 전체를 메모리에 올리는 대신, 항상 사용되는 밀집(Dense) 부분(약 17B 파라미터)만 RAM에 상주시키고, 나머지 전문가(Expert) 가중치는 디스크에 저장한 뒤 토큰 생성 시 필요한 부분만 스트리밍하는 방식입니다. 이를 통해 데이터센터급 GPU 없이도 거대 모델을 구동할 수 있습니다.
주요 기술적 특징은 다음과 같습니다:
- 지능형 캐싱: 사용 패턴을 학습하여 자주 호출되는 전문가를 RAM에 미리 고정하는 LRU 캐시 및 예측 캐싱 기능을 제공합니다.
- MLA 및 압축 KV 캐시: GLM-5.2의 MLA 어텐션을 구현하여 KV 캐시 크기를 기존 대비 약 57배 압축했습니다.
- MTP(Multi-Token Prediction) 지원: 네이티브 MTP 추측 디코딩을 통해 추론 속도를 향상시키며, 문법 강제(Grammar Constrained) 기능을 통해 JSON 등 특정 형식의 출력 정확도를 높였습니다.
- 경량화된 설계: Python이나 GPU 없이도 작동하는 단일 C 파일 기반의 엔진이며, AVX2 명령어를 사용하는 정수 행렬곱 커널을 포함합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.