colibri: 744B MoE 모델을 소비자용 하드웨어에서 구동하는 초경량 추론 엔진
JustVugg/colibri
·2026.09.10 23:36
프로젝트 소개
VRAM, RAM, 스토리지를 하나의 계층으로 통합해 744B에서 2.8T 파라미터 규모의 MoE 모델을 소비자용 하드웨어에서 실행한다. 순수 C로 작성된 이 엔진은 의존성을 최소화하며, GLM-5.2, Kimi K3, DeepSeek V4 Flash 등 최신 대형 모델을 단일 인터페이스로 지원한다.
가중치를 메모리에 상주시키지 않고 라우팅 히트에 따라 JIT 방식으로 필요할 때만 로드하는 전략을 채택했다. 라우터가 다음 레이어를 미리 계산해 프리페치를 수행하고, CPU와 GPU, NVMe를 혼용해 대역폭 병목을 해결한다. 이를 통해 제한된 VRAM 환경에서도 모델의 정확도를 유지하며 추론 속도를 확보한다.
웹 대시보드를 통해 19,456개의 전문가가 실시간으로 라우팅되는 과정을 시각화하고, 각 전문가의 주제 선호도와 저장 계층을 확인할 수 있다. 하이퍼스케일러급 장비 없이도 프런티어 모델의 내부 동작을 직접 측정하고 최적화할 수 있어, 저비용으로 대형 LLM을 운영하거나 연구하려는 개발자에게 적합하다.
GitHub 저장소
JustVugg/colibri
Run frontier MoE models on hardware you already own — pure C, zero deps, experts streamed from disk. Tiny engine, immense model. 🐦
C
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.






