AI Briefing

추천오픈소스 데이터 추출 서비스

·2026.07.18 10:07

LangChain이 비정형 문서에서 구조화된 데이터를 자동 추출하는 호스팅 서비스를 공개했다.

LangChain오픈소스 데이터 추출 서비스의 호스팅 버전을 공개했다. PDF, HTML, 텍스트 등 비정형 데이터에서 구조화된 정보를 **대규모언어모델(LLM)**을 활용해 자동으로 추출하는 서비스다. 프로덕션 용도는 아니지만 개발자들이 자신의 애플리케이션 구축을 시작하기 위한 레퍼런스로 설계됐다.

서비스는 사용자 정의 스키마 정의, few-shot 예제 학습, LLM 모델 변경, 사용자 간 추출기 공유 등의 기능을 지원한다. 웹 프론트엔드에서는 자연어로 추출 스키마를 정의하고 테스트할 수 있으며, LangServe 엔드포인트를 통해 기존 LangChain 워크플로우에 통합할 수도 있다.

실제 사용 사례로, Uber의 2023년 4분기 실적설명회 PDF에서 재무 데이터를 추출하는 예제를 보여준다. 수익, EBITDA 등 핵심 재무 지표를 자동으로 추출하고 해당 증거 문장까지 함께 제시한다. 초기 추출 결과의 형식이 스키마 명세와 맞지 않을 경우, few-shot 예제를 추가하면 LLM이 의도한 형식으로 정확히 추출하도록 개선할 수 있음을 시연한다.

개발자는 Python 클라이언트를 통해 서비스를 사용할 수 있다. Pydantic으로 스키마를 정의하고, HTTP 요청으로 추출기를 생성한 뒤 문서를 업로드해 결과를 받는다. LangServe의 RemoteRunnable 인터페이스로도 접근 가능해, 벡터 검색 등 더 복잡한 파이프라인에 조합할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.