AI Briefing

Rust 기반 PDF 마크다운 추출 도구 공개

pdf-inspector: OCR 없이 PDF를 분류하고 마크다운으로 추출하는 Rust 라이브러리 (feat. firecrawl)

·2026.07.15 08:30

OCR 없이 PDF의 텍스트 여부를 판별하고 마크다운으로 변환하는 고성능 Rust 라이브러리입니다.

웹 크롤링 도구인 Firecrawl이 자사 파이프라인 최적화를 위해 개발한 pdf-inspector는 PDF 문서를 분석하여 텍스트 기반인지 스캔본(이미지)인지 밀리초 단위로 판별합니다.

이 라이브러리는 다음과 같은 핵심 기능을 제공합니다:

  • PDF 타입 분류: 문서 전체를 로드하지 않고 샘플링을 통해 TextBased, Scanned, ImageBased, Mixed 유형으로 분류하며, 텍스트가 없는 페이지 번호를 반환하여 필요한 부분만 OCR을 수행하도록 지원합니다.
  • 고성능 마크다운 변환: 폰트 크기, 스타일, 레이아웃 분석을 통해 제목(H1~H4), 목록, 코드 블록, 표(Table) 등을 인식하여 마크다운 형식으로 추출합니다.
  • 효율적인 파이프라인: Rust로 구현되어 200ms 이내에 로컬 처리가 가능하며, 중복 I/O를 방지하기 위해 파싱 결과를 분류와 추출 단계에서 공유합니다.

벤치마크 결과, 기존의 pymupdf4llm 등과 비교했을 때 표(Table) 인식 성능처리 속도 면에서 우수한 성능을 보였습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.