AI Briefing

vLLM 기반 encoder 서빙 도구 공개

I open-sourced vLLM Factory: encoder model serving via vLLM plugins - GLiNER, GLiNER2, ColBERT, ColPali, custom poolers (incl. I/O pocessors)

·2026.05.06 20:22

vLLM 플러그인을 통해 GLiNER, ColBERT 등 encoder 모델을 효율적으로 서빙할 수 있는 vLLM Factory가 오픈소스로 공개되었다.

vLLM을 포크(fork)하지 않고도 encoder-styleretrieval 모델을 서빙할 수 있도록 설계된 vLLM Factory 프로젝트가 오픈소스로 출시되었다.

기존 RAG(검색 증강 생성) 및 정보 추출 시스템에서 encoder 모델을 서빙하기 위해 별도의 PyTorch/FastAPI 서버를 구축해야 했던 비효율성을 해결하는 것을 목표로 한다.

주요 특징 및 지원 사항:

  • 지원 모델: GLiNER/GLiNER2, ColBERT/ModernColBERT, ColPali 스타일의 멀티모달 검색, Embedding 모델 및 커스텀 풀러 지원.
  • IOProcessor: 서버 측 전/후처리를 위한 플러그인 방식 도입.
  • GPU 활용 최적화: 메모리 집약적인 encoder 워크로드를 위해 GPU당 멀티 인스턴스 서빙을 지원하여 처리량(throughput)과 지연 시간을 개선.
  • 유지보수성: vLLM 코드를 직접 수정하지 않는 플러그인 구조를 채택하여 vLLM 업데이트와 호환성을 유지함.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.