AI Briefing

Edge0, SSD 스트리밍으로 35B MoE 모델 3GiB 메모리 실행

edge0: 35B MoE 모델을 활성 메모리 3GiB로 실행하는 SSD 전문가 스트리밍 추론 프레임워크

·2026.09.15 08:30

핵심 내용

Edge0가 SSD 전문가 스트리밍 기술로 35B MoE 모델을 3GiB 메모리로 실행하는 추론 프레임워크를 공개했다.

1 / 3

자세히 보기

개발사 Edge0가 SSD 전문가 스트리밍 추론 프레임워크를 공개했다. 이 기술은 Apple Silicon의 제한된 통합 메모리 환경에서 대규모 MoE(Mixture of Experts) 모델을 효율적으로 실행하기 위해 개발되었다.

핵심 기술 및 아키텍처

  • SSD 전문가 스트리밍: 모델 가중치를 SSD에 보관(mmap)하고 필요 시에만 GPU로 로드한다. LRU 캐시와 고정 슬롯을 사용해 저장장치 지연을 최소화한다.
  • 프리라우터(Prerouter): 다음 층의 라우팅을 한 스텝 먼저 예측하여 저장장치 접근 지연을 숨긴다. 이 예측 장치는 모델과 함께 학습 및 배포되어 디코드 처리량을 최대 59% 향상시킨다.
  • Recover-LoRA: 4비트 양자화로 인한 품질 저하를 복원하기 위해 fp16 교사 모델로부터 증류 학습한 LoRA 어댑터를 적용한다.

성능 및 벤치마크

  • 메모리 효율: edge0-35b 모델은 피크 활성 메모리 2.9 GiB, edge0-8b 모델은 1.0 GiB를 사용한다. 이는 전체 상주 방식 대비 매우 낮은 메모리 점유율이다.
  • 처리 속도: Mac mini M4 Pro(24GB) 기준 edge0-35b는 디코드 14.9~17.7 tok/s, edge0-8b는 23.9~25.3 tok/s를 기록한다.
  • 품질: OpenCompass 벤치마크에서 edge0-35b(int4)는 원본 fp16 모델 대비 평균 3.9점 낮은 79.2점을 기록하며, 4비트 양자화임에도 높은 품질을 유지한다.

배포 및 제한 사항

  • 현재 MLX 백엔드만 지원하며 Apple Silicon(M1-M4) 전용이다. CUDA 지원은 아직 구현되지 않았다.
  • Apache-2.0 라이선스로 배포되며, OpenAI 호환 엔드포인트를 제공한다. 한국어 능력은 검증되지 않았다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.