AI Briefing

16GB GPU용 35B MoE 구동 Luce Spark 공개

Luce Spark: a 35B MoE on a 16 GB GPU, without the offload tax

·2026.06.09 00:24

실시간 라우팅 패턴을 학습해 MoE 전문가를 GPU에 효율적으로 상주시키는 Luce Spark가 공개되었다.

Luce Spark는 16GB GPU 환경에서 33B~35B 규모의 MoE(Mixture-of-Experts) 모델을 효율적으로 실행할 수 있게 해주는 오픈소스 도구입니다.

기존의 단순한 오프로드 방식과 달리, 실제 추론 시 발생하는 라우팅 패턴을 학습하여 자주 사용되는 'Hot' 전문가(Expert)는 GPU에 유지하고, 나머지는 시스템 RAM에 두어 필요할 때만 스왑하는 방식을 사용합니다. 별도의 사전 캘리브레이션 없이 실시간으로 최적화되며, 모델 재시작 시 학습된 프로필이 업데이트됩니다.

주요 성능 및 특징:

  • 높은 효율성: RTX 3090 기준, 전문가의 60%만 GPU에 상주해도 약 100 tok/s를 기록하며, 이는 기존 단순 오프로드 방식(66 tok/s) 대비 1.5배 빠른 속도입니다.
  • 실시간 최적화: 별도의 코퍼스(Corpus) 없이 실시간 라우팅 데이터를 기반으로 전문가 배치를 학습합니다.
  • 오픈소스: Apache 2.0 라이선스로 GitHub에 공개되었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.