NPU 기반 LLM 서빙: 확장성과 효율성을 극대화한 재설계
·2025.08.24 11:36
리벨리온이 FlashAttention 등을 NPU에 최적화하여 vLLM과 호환되는 고효율 LLM 서빙 기술을 공개했다.
LLM 시대의 핵심은 모델 실행을 넘어 효율적이고 확장 가능한 서빙 시스템을 설계하는 것이다. 기존 GPU 기반 서빙은 높은 전력 소모와 비용 문제가 있으며, 이를 해결하기 위해 NPU 아키텍처에 최적화된 서빙 방식이 요구된다.
**리벨리온(Rebellions)**은 FlashAttention, PagedAttention, Sliding Window Attention을 NPU의 메모리 계층과 연산 모델에 맞춰 재설계했다. 이를 통해 vLLM RBLN 플러그인을 제공하여, 기존 vLLM 워크플로우를 수정하지 않고도 NPU의 성능을 즉시 활용할 수 있게 했다.
주요 최적화 기술은 다음과 같다:
- FlashAttention: NPU의 로컬 SRAM 크기에 최적화된 타일 기반 커널을 구현하여 DRAM 접근을 줄이고 연산 효율을 높였다.
- PagedAttention: KV 캐시를 논리적 블록 단위로 관리하여 메모리 파편화를 방지하며, dynamic DMA를 통해 유연한 메모리 주소 접근을 지원한다.
- Causal Mask & SDPA: 연산 프리미티브 내부에서 Causal Mask를 자동 처리하고, PyTorch의 SDPA 인터페이스를 완벽히 지원한다.
이러한 기술은 **RSD(Rebellions Scalable Design)**의 기반이 되어, 멀티 노드 배포와 MoE 라우팅을 지원하는 확장 가능한 분산 시스템 구축을 가능하게 한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.