AI Briefing

vLLM 핸즈온 워크숍 후기

·2025.11.10 10:33

Rebellions와 SqueezeBits가 NPU에서 vLLM을 직접 돌리는 실습 워크숍을 열었다.

Rebellions와 SqueezeBits가 10월 29일 공동으로 vLLM Hands-on Workshop을 열며, 국내 NPU 기업이 주도한 첫 개발자 대상 실습형 행사라는 점을 강조했다.

참가자 설문에서는 전원이 ‘만족’ 이상으로 응답했고, 가장 큰 반응은 Rebellions NPU에서 vLLM을 직접 실행해 본 경험이었다. PyTorch에 익숙한 개발자라면 별도 추가 설정 없이 따라갈 수 있었다는 점도 긍정적으로 평가됐다.

워크숍은 NPU 도입에 대한 대표적인 의문을 직접 다뤘다.

  • 기존 코드나 MLOps 파이프라인을 크게 바꿔야 하는지
  • Hugging Face, PyTorch, vLLM과 얼마나 자연스럽게 연동되는지
  • MoE(Mixture-of-Experts) 모델을 NPU에 어떻게 효율적으로 분산할 수 있는지

실습 환경은 ATOM™ NPU serversKubernetes 기반 리소스 풀 위에 구축됐고, 참가자별로 전용 NPU 노드가 할당됐다. 첫 세션에서는 GPU와 같은 코드 구조로 동작하는 PyTorch Eager Mode를 체험하며, 단일 명령만으로 NPU에서 텐서 연산을 실행했고, Phi-3 0.6B 모델 추론도 Hugging Face Transformers로 수행했다.

이후 Graph Mode 세션에서는 RBLN ProfilerPerfetto를 이용해 NPU 실행 트레이스와 파이프라인 구조를 타일 단위로 분석했다. 또한 PrefillDecode 그래프를 분리 컴파일하고, FlashAttentionKV Caching 같은 최적화 커널을 적용해 Eager Mode 대비 향상된 성능을 확인했다.

행사의 핵심은 vLLM-Rebellions backend plugin이었다. 이 플러그인은 torch.compile 기반으로 vLLM을 Rebellions 하드웨어에 연결하고, Paged AttentionContinuous Batching을 NPU에서 직접 구현해 실제 배포 환경에서의 메모리 효율과 처리량을 높였다.

또한 OpenAI-compatible API endpoint를 제공해 기존 API 워크플로를 크게 바꾸지 않고도 Rebellions의 하드웨어 가속을 활용할 수 있게 했다. 마지막 데모에서는 Qwen1.5-MoE 모델의 분산 추론을 통해 tensor parallelism과 expert parallelism을 함께 활용하는 모습을 보여줬고, Rebellions는 앞으로 vLLM-RBLN에 공식 MoE 지원을 준비 중이라고 밝혔다.

워크숍은 단순 데모를 넘어, Hugging Face, PyTorch, vLLM이 NPU 환경에서 자연스럽게 이어지는 production-grade Kubernetes 기반 실습 환경을 제시했다. Rebellions와 SqueezeBits는 향후 2년간 정기 워크숍을 이어가며, 한국 개발자들이 NPU 기반 vLLM 배포를 서비스 수준에서 익힐 수 있도록 지원할 계획이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.