AI Briefing

Xberg, 101개 포맷 추출 엔진

Xberg: 101개 문서 포맷에서 텍스트와 표를 뽑아내는 Rust 기반 문서 추출 엔진

·2026.08.10 18:30

핵심 내용

Xberg가 Rust 코어로 101개 문서 포맷의 텍스트·표·메타데이터 추출을 지원한다.

1 / 2

자세히 보기

Xberg는 PDF, 오피스 문서, 이미지, HTML, 이메일, 전자책, 학술 문서, 구조화 데이터 등 101개 포맷에서 텍스트와 표를 추출하는 Rust 기반 문서 인텔리전스 엔진이다.

포맷 감지, 문서 읽기, OCR, 구조화 추출을 단일 코어에서 처리하며, 다음 방식으로 사용할 수 있다.

  • Python, Node.js, Go, Java, C#, Ruby, PHP, Elixir 등 15개 언어 바인딩
  • 라이브러리, CLI, REST API 서버, MCP 서버
  • 일반 텍스트, Markdown, Djot, HTML, JSON 트리, OCR 메타데이터·바운딩 박스를 포함한 Structured 출력

국내 문서 처리에서 활용도가 높은 HWP·HWPX 포맷도 지원한다. 코드 저장소를 입력하면 tree-sitter 기반으로 371개 프로그래밍 언어의 함수, 클래스, import, 심볼, 독스트링을 추출하고 구문 경계에 맞춰 청킹할 수 있다.

Xberg가 공개한 벤치마크의 전체 코퍼스 p50 비교에서는 Markdown 출력 기준 처리량 1.70MB/s, 콜드 스타트 203ms, 성공률 100%, 최대 메모리 32MB를 기록했다고 밝혔다. 다만 레이아웃 점수는 Docling이 0.884로 더 높았으며, 해당 성능 수치는 Xberg 측 벤치마크 결과다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.