Edge0, SSD 스트리밍으로 35B MoE 모델 3GiB 메모리 실행
edge0: 35B MoE 모델을 활성 메모리 3GiB로 실행하는 SSD 전문가 스트리밍 추론 프레임워크
·2026.09.15 08:30
핵심 내용
Edge0가 SSD 전문가 스트리밍 기술로 35B MoE 모델을 3GiB 메모리로 실행하는 추론 프레임워크를 공개했다.
1 / 3
자세히 보기
개발사 Edge0가 SSD 전문가 스트리밍 추론 프레임워크를 공개했다. 이 기술은 Apple Silicon의 제한된 통합 메모리 환경에서 대규모 MoE(Mixture of Experts) 모델을 효율적으로 실행하기 위해 개발되었다.
핵심 기술 및 아키텍처
- SSD 전문가 스트리밍: 모델 가중치를 SSD에 보관(mmap)하고 필요 시에만 GPU로 로드한다. LRU 캐시와 고정 슬롯을 사용해 저장장치 지연을 최소화한다.
- 프리라우터(Prerouter): 다음 층의 라우팅을 한 스텝 먼저 예측하여 저장장치 접근 지연을 숨긴다. 이 예측 장치는 모델과 함께 학습 및 배포되어 디코드 처리량을 최대 59% 향상시킨다.
- Recover-LoRA: 4비트 양자화로 인한 품질 저하를 복원하기 위해 fp16 교사 모델로부터 증류 학습한 LoRA 어댑터를 적용한다.
성능 및 벤치마크
- 메모리 효율: edge0-35b 모델은 피크 활성 메모리 2.9 GiB, edge0-8b 모델은 1.0 GiB를 사용한다. 이는 전체 상주 방식 대비 매우 낮은 메모리 점유율이다.
- 처리 속도: Mac mini M4 Pro(24GB) 기준 edge0-35b는 디코드 14.9~17.7 tok/s, edge0-8b는 23.9~25.3 tok/s를 기록한다.
- 품질: OpenCompass 벤치마크에서 edge0-35b(int4)는 원본 fp16 모델 대비 평균 3.9점 낮은 79.2점을 기록하며, 4비트 양자화임에도 높은 품질을 유지한다.
배포 및 제한 사항
- 현재 MLX 백엔드만 지원하며 Apple Silicon(M1-M4) 전용이다. CUDA 지원은 아직 구현되지 않았다.
- Apache-2.0 라이선스로 배포되며, OpenAI 호환 엔드포인트를 제공한다. 한국어 능력은 검증되지 않았다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.