AI Briefing

WASTE, NVMe로 초대형 모델 실행

GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.

·2026.08.03 09:16

WASTE가 활성화된 전문가 가중치를 NVMe에서 스트리밍해 RAM보다 큰 Kimi K3 실행을 지원한다.

WASTE는 서드파티 런타임 의존성 없이 동작하는 임베디드 C 기반 추론 엔진이다.

모델의 trunk는 메모리에 유지하고, MoE 모델에서 선택된 expert 가중치만 NVMe에서 직접 스트리밍한다. 남은 RAM은 크기가 제한된 expert 캐시로 활용한다.

이 구조를 통해 가용 RAM 용량을 초과하는 2.78조 파라미터 Kimi K3 모델의 실행을 목표로 한다. 다만 게시글에는 성능, 지원 하드웨어, 라이선스 등 추가 운영 정보는 제시되지 않았다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.