AI Briefing

VRAM 전문가 캐시

Hot Experts in your VRAM! Dynamic expert cache in llama.cpp for 27% faster CPU +GPU token generation with Qwen3.5-122B-A10B compared to layer-based single-GPU partial offload

·2026.04.15 12:20

핵심 내용

llama.cpp의 동적 expert cache가 Qwen3.5-122B-A10B 토큰 생성 속도를 27% 끌어올렸다.

자세히 보기

llama.cpp에 dynamic expert cache를 적용해, Qwen3.5-122B-A10B의 CPU+GPU 토큰 생성을 최적화한 결과가 공유됐다.

기존의 layer-based single-GPU partial offload 방식과 비교했을 때, 동적 expert cache가 27% 더 빠른 성능을 보였다.

핵심 포인트는 다음과 같다.

  • VRAM에 자주 쓰는 expert를 유지해 불필요한 이동을 줄임
  • CPU+GPU 혼합 추론에서 토큰 생성 효율을 개선
  • llama.cpp 환경에서 MoE 모델 오프로딩 전략의 대안을 제시

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.