Unstract, 비정형 문서용 LLM 데이터 추출 플랫폼 공개
Unstract: 프롬프트로 비정형 문서에서 구조화된 JSON을 추출하는 LLM 플랫폼
·2026.07.28 14:30
자연어 프롬프트를 사용하여 비정형 문서에서 구조화된 JSON 데이터를 추출하는 오픈소스 플랫폼 Unstract가 공개되었습니다.
Unstract는 계약서, 청구서, 이력서와 같이 정해진 틀이 없는 비정형 문서에서 필요한 데이터를 추출하여 구조화된 JSON 형태로 변환해 주는 LLM 기반 플랫폼입니다.
기존의 정규식이나 템플릿 기반 방식과 달리, 사용자는 자연어 프롬프트를 통해 추출할 필드와 형식을 정의할 수 있어 문서 양식이 변경되더라도 유연하게 대응할 수 있습니다. 추출된 데이터는 REST API를 통해 기존 애플리케이션에 연결하거나, ETL 파이프라인을 통해 데이터 웨어하우스에 배치 처리할 수 있습니다.
주요 특징 및 아키텍처:
- 멀티 LLM 지원: OpenAI, Anthropic, Google Gemini는 물론 Ollama를 통한 로컬 모델 연동을 지원합니다.
- 다양한 커넥터: AWS S3, Google Drive 등 다양한 스토리지와 Qdrant, Pinecone 등 벡터 DB, Snowflake, BigQuery 등 다양한 목적지를 지원합니다.
- 기술 스택: React(프런트엔드), Django(백엔드), Celery(비동기 작업), PostgreSQL(데이터베이스) 기반의 견고한 아키텍처를 갖추고 있습니다.
- 확장성: Docker Compose를 통해 자체 호스팅이 가능하며, MCP(Model Context Protocol) 서버를 통해 AI 에이전트와도 연결할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.