SIE, 에이전트 모델 통합 서빙
SIE: 에이전트가 쓰는 임베딩부터 OCR까지 한 클러스터에서 서빙하는 오픈소스 추론 엔진
·2026.08.12 12:30
핵심 내용
SIE가 임베딩·리랭킹·OCR·LLM을 하나의 OpenAI 호환 API로 통합 서빙한다.
자세히 보기
Superlinked의 **SIE(Superlinked Inference Engine)**는 에이전트에 필요한 임베딩, 검색·리랭킹, 문서 OCR·변환, 구조화된 출력, 콘텐츠 안전성 판정, LLM 에이전트 루프를 하나의 자체 호스팅 추론 엔진으로 통합한다.
/v1/embeddings,/v1/chat/completions,/v1/completions,/v1/responses등 OpenAI 호환 API를 제공한다.- 100종이 넘는 모델을 요청 시 내려받아 적재하고, 사용하지 않는 모델은 LRU 방식으로 메모리에서 제거한다.
bge-m3,splade-v3,qwen3-reranker,lightonocr,glm-ocr,paddleocr-vl,docling,granite-guardian-2b등 다양한 모델을 작업별로 선택할 수 있다.- 부하 분산 게이트웨이, KEDA 오토스케일링, Grafana 대시보드, GKE·EKS·AKS용 Terraform 모듈도 함께 제공한다.
여러 종류의 모델을 한 클러스터에서 운영하며 GPU 메모리 활용도를 높일 수 있지만, 모델을 처음 적재할 때는 가중치 다운로드로 지연이 발생한다. 단일 생성 모델의 높은 처리량이 목표라면 vLLM이나 SGLang 같은 전용 서버가 더 적합하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.