AI Briefing

WARP, 64GB 맥북서 K3 실행

WARP: 2.78조 파라미터 Kimi K3를 64GB 맥북에서 실행하는 C 기반 추론 엔진

·2026.08.12 18:30

핵심 내용

WARP가 64GB MacBook에서 2.78조 파라미터 Kimi K3의 로컬 추론을 구현했다.

자세히 보기

**WARP(W​​eight-Aware Runtime and Paging)**는 MoE 모델의 전체 가중치를 RAM에 올리지 않고, 공용 가중치와 선택된 전문가만 메모리에 유지하는 C 기반 추론 엔진이다.

  • 대상 모델: 2.78조 파라미터 Kimi K3
  • 메모리: 4K 문맥 기준 약 29.19GB
  • 저장공간: 변환된 모델 약 982GB
  • 성능: M5 Pro·64GB MacBook Pro에서 초당 0.45~0.62토큰
  • 추론 의존성: libc와 pthreads 외 BLAS, Python, CUDA 불필요

전문가 가중치는 NVMe에서 직접 읽고, 계산과 디스크 읽기를 겹치며, 남은 RAM은 전문가 캐시로 사용한다. 3비트 잔차 벡터 양자화와 공용 가중치의 4·8비트 양자화를 조합하고, Kimi K3의 압축 KV 캐시도 활용한다.

캐시를 무작정 늘리면 성능이 오히려 급락한다. 전문가 캐시를 17.32GB로 설정했을 때는 0.63토큰/초였지만, 23.32GB 이상에서는 호스트 메모리 압박으로 페이지 폴트가 발생해 0.07~0.09토큰/초로 떨어졌다.

토큰당 전문가 수를 기본값 16에서 8로 줄이면 속도는 1.49배 빨라지지만 KL 발산이 0.037로 증가한다. 디스크 성능의 영향도 커서, 내장 SSD의 12.78GB/s 처리량과 달리 USB 외장 스토리지는 0.94GB/s에 그쳤다.

프로젝트는 아직 포맷과 API가 안정화되지 않은 실험 단계이며, 대화형 서비스보다는 대규모 MoE의 로컬 검증·배치 처리·추론 구조 연구에 적합하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.