AI Briefing

Xberg v1, Rust 기반 AI 추출 공개

Xberg v1 is out

·2026.08.02 18:06

Xberg v1이 PDF·OCR·문서·멀티미디어 처리를 아우르는 콘텐츠 인텔리전스 엔진으로 출시됐다.

Xberg v1이 문서와 코드·데이터, 오디오·비디오, 정적·동적 URL에서 콘텐츠를 추출·정제하는 오픈소스 콘텐츠 인텔리전스 프레임워크로 출시됐다. 기존 Kreuzberg v4의 후속 버전이다.

주요 변경 사항은 다음과 같다.

  • 순수 Rust PDF 백엔드 pdf_oxide를 도입해 네이티브 pdfium 의존성을 제거했다.
  • ONNX 기반 레이아웃 탐지와 predecessor graph 재정렬을 결합해 문서 읽기 순서를 복원한다.
  • 페이지별 스캔 여부를 판별해 필요한 페이지만 OCR 처리하고, AcroForm/XFA 필드와 PDF 목차 기반 제목도 지원한다.
  • PaddleOCR PP-OCRv6, Tesseract를 지원하며 TrOCR·GLM-OCR·GOT-OCR·DeepSeek-OCR·PaddleOCR-VL용 순수 Rust Candle 추론 스택을 제공한다.
  • tract 기반 ONNX Runtime 비의존 추론 경로로 WASM 브라우저 및 모바일 추론을 지원한다.
  • Rust 네이티브 GLiNER2 개체명 인식과 브라우저용 WASM 모델을 제공한다.
  • 문서 형식 101종, 코드·데이터 형식 367종을 처리하며, OCR과 PDF 추출의 메모리 사용량·모델 세션·스트리밍 변환도 최적화했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.