AI Briefing

NPU 기반 LLM 서빙: 확장성과 효율성을 극대화한 재설계

·2025.08.24 11:36

핵심 내용

리벨리온이 FlashAttention 등을 NPU에 최적화하여 vLLM과 호환되는 고효율 LLM 서빙 기술을 공개했다.

1 / 2

자세히 보기

LLM 시대의 핵심은 모델 실행을 넘어 효율적이고 확장 가능한 서빙 시스템을 설계하는 것이다. 기존 GPU 기반 서빙은 높은 전력 소모와 비용 문제가 있으며, 이를 해결하기 위해 NPU 아키텍처에 최적화된 서빙 방식이 요구된다.

**리벨리온(Rebellions)**은 FlashAttention, PagedAttention, Sliding Window Attention을 NPU의 메모리 계층과 연산 모델에 맞춰 재설계했다. 이를 통해 vLLM RBLN 플러그인을 제공하여, 기존 vLLM 워크플로우를 수정하지 않고도 NPU의 성능을 즉시 활용할 수 있게 했다.

주요 최적화 기술은 다음과 같다:

  • FlashAttention: NPU의 로컬 SRAM 크기에 최적화된 타일 기반 커널을 구현하여 DRAM 접근을 줄이고 연산 효율을 높였다.
  • PagedAttention: KV 캐시를 논리적 블록 단위로 관리하여 메모리 파편화를 방지하며, dynamic DMA를 통해 유연한 메모리 주소 접근을 지원한다.
  • Causal Mask & SDPA: 연산 프리미티브 내부에서 Causal Mask를 자동 처리하고, PyTorch의 SDPA 인터페이스를 완벽히 지원한다.

이러한 기술은 **RSD(Rebellions Scalable Design)**의 기반이 되어, 멀티 노드 배포와 MoE 라우팅을 지원하는 확장 가능한 분산 시스템 구축을 가능하게 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.