VRAM 전문가 캐시
Hot Experts in your VRAM! Dynamic expert cache in llama.cpp for 27% faster CPU +GPU token generation with Qwen3.5-122B-A10B compared to layer-based single-GPU partial offload
·2026.04.15 12:20
핵심 내용
llama.cpp의 동적 expert cache가 Qwen3.5-122B-A10B 토큰 생성 속도를 27% 끌어올렸다.
자세히 보기
llama.cpp에 dynamic expert cache를 적용해, Qwen3.5-122B-A10B의 CPU+GPU 토큰 생성을 최적화한 결과가 공유됐다.
기존의 layer-based single-GPU partial offload 방식과 비교했을 때, 동적 expert cache가 27% 더 빠른 성능을 보였다.
핵심 포인트는 다음과 같다.
- VRAM에 자주 쓰는 expert를 유지해 불필요한 이동을 줄임
- CPU+GPU 혼합 추론에서 토큰 생성 효율을 개선
- llama.cpp 환경에서 MoE 모델 오프로딩 전략의 대안을 제시
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.