LayerStoRm, 소비자 GPU LLM 서빙
LayerStoRm: Run frontier-scale MoE LLMs on a handful of consumer GPUs by streaming experts over PCIe.
·2026.08.25 12:38
핵심 내용
PCIe 스트리밍을 활용해 소비자용 GPU에서 대규모 MoE LLM을 실행하는 오픈소스 엔진 LayerStoRm이 공개됐다.
자세히 보기
제한된 VRAM 환경에서 프런티어 스케일 MoE LLM을 서빙하기 위한 오픈소스 엔진 LayerStoRm이 공개되었다. 이 도구는 RAM과 PCIe 병렬 전송을 활용하여 토큰이 실제로 라우팅되는 전문가(expert)만 가져오는 방식으로 동작하며, 사전 로드된 VRAM을 스마트 캐시로 활용한다.
성능 및 구성
테스트 환경은 RTX 5090 2개, RTX 5080 2개, 512GB RAM 구성이다. GLM 5.2 UD-Q4_K_XL 모델을 실행할 때 초당 약 10개의 생성 토큰과 초당 약 44개의 프롬프트 처리 속도를 기록했다. 이는 동일 구성에서 llama-bench를 사용할 때의 1.37 gen tok/sec 대비 현저히 높은 수치다.
주요 기술 특징
- 커스텀 전송 스케줄링: 각 토큰-레이어별 최적 전송 설정을 반복적으로 해결하는 마이크로 최적화 솔버 적용
- KV 캐시 관리: HiSparse KV 오프로딩, TurboQuant 또는 SnapMLA KV 압축, PagedAttention 지원
- 하드웨어 최적화: NUMA 최적화, Pinned RAM, DMA 워터라인 큐를 통한 저지연 전송
- 서빙 기능: OpenAI 호환 API, 도구 호출, 스트리밍, TP > 1 시 KV 캐시 및 모델 가중치 샤딩
현재는 GLM 5.2, DeepSeek V4, DeepSeek 3.2 아키텍처만 지원하며, Linux와 Nvidia RTX 5080-5090 계열 GPU에 한정된다. MIT 라이선스로 공개되어 있으며, 향후 AMD 및 하이브리드 지원이 계획되어 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.