AI Briefing

Firecrawl, Rust 기반 PDF 인스펙터 오픈소스 공개

·2·2026.08.24 01:19

Firecrawl이 개발한 pdf-inspector는 Rust 기반의 고속 PDF 처리 라이브러리입니다. 텍스트 기반 PDF와 스캔 이미지 PDF를 빠르게 분류하고, 텍스트 추출 및 마크다운 변환을 수행합니다. OCR이 불필요한 텍스트 기반 PDF를 로컬에서 200ms 미만으로 처리하여 불필요한 OCR 서비스 호출 비용을 절감하는 것이 핵심 목적입니다.

PDF 파이프라인을 구축하는 개발자나, 대량의 문서 데이터를 LLM에 입력하기 전 전처리 과정이 필요한 팀에 적합합니다. 특히 OCR 비용이 큰 부담인 환경이나, 브라우저 환경에서 서버 왕복 없이 로컬 처리가 필요한 웹 애플리케이션 개발 시 활용 가치가 높습니다.

  • 스마트 분류: 콘텐츠 스트림 샘플링을 통해 텍스트, 스캔, 이미지, 혼합 PDF를 10~50ms 내에 감지하고 신뢰도 점수를 반환합니다.
  • 정밀한 텍스트 추출: 폰트 정보와 좌표를 기반으로 한 위치 인식 추출, 다중 컬럼 레이아웃 자동 감지, RTL 텍스트 지원이 가능합니다.
  • 마크다운 변환: 폰트 크기 비율을 활용한 헤딩(H1-H4) 생성, 코드 블록 감지, 테이블 구조 복원, 볼드/이탤릭 포맷 적용을 지원합니다.
  • 다양한 바인딩: Rust 네이티브, CLI, Python, Node.js, 그리고 브라우저용 WebAssembly 버전을 제공합니다.
  • 선택적 OCR: Rust, CLI, Python, Node 환경에서 OCR이 필요한 페이지만 선택적으로 렌더링하여 PP-OCRv6 Small을 로컬에서 실행할 수 있습니다.

MIT 라이선스로 공개된 이 프로젝트는 cargo add pdf-inspector 또는 npm, pip 패키지로 설치할 수 있습니다. 기본 빌드는 순수 추출 기능에 집중하며, OCR 기능은 외부 의존성(PDFium, ONNX Runtime 등)을 선택적으로 로드하는 구조입니다.