AI Briefing

pdf-inspector: 200ms 내 PDF 텍스트 추출, OCR 생략으로 속도 확보

firecrawl/pdf-inspector

·2026.08.30 20:14

텍스트 기반 PDF 처리 속도를 200ms 이내로 단축한다. 전체 PDF의 약 54%는 OCR이 불필요한 텍스트 기반 문서이므로, 이를 자동 분류해 무거운 OCR 서비스를 건너뛴다. Rust로 작성되어 Python, Node.js, 브라우저 WebAssembly 등 다양한 환경에서 동일한 성능을 제공한다.

단순 텍스트 추출을 넘어 위치 인식 기반의 구조화 Markdown을 생성한다. 글꼴 크기와 배치를 분석해 H1~H4 제목, 목록, 코드 블록, 표를 자동으로 인식하며, 신문식 다단 레이아웃과 RTL 텍스트도 지원한다. 표 감지는 PDF 내 직선 드로잉과 텍스트 정렬을 모두 활용하는 이중 모드로 작동한다.

opendataloader-bench 기준 200개 문서 처리에 0.47초가 소요되어 기존 도구 대비 압도적인 속도를 보인다. LiteParse, PyMuPDF4LLM 등과 비교해 전체 점수, 읽기 순서 정확도, 표 인식률에서 모두 높은 성적을 기록했다. 보고서, 연구 논문, 재무 문서 등 구조가 중요한 텍스트 PDF를 로컬에서 빠르게 처리해야 할 때 적합하다.

GitHub
GitHub 저장소

firecrawl/pdf-inspector

Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.

Rust

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.