읽는 방식에 따라 내용이 변하는 PDF
·2026.06.13 01:32
PDF의 'marked-content' 속성을 활용해 인간용 시각 정보와 LLM용 마크다운 구조를 동시에 제공하는 기술을 소개한다.
기존 PDF는 시각적 좌표 기반의 포맷으로, LLM이 구조(헤더, 리스트, 표 등)를 파악하기 위해 텍스트 추출 과정에서 구조를 재구성해야 하는 어려움이 있습니다.
이 방식은 PDF 1.4 스펙의 replacement text(대체 텍스트) 속성을 활용합니다. 렌더러는 시각적 요소를 그대로 그리지만, PyMuPDF나 Poppler 같은 텍스트 추출 도구는 지정된 마크다운(Markdown) 구조를 반환하도록 설계되었습니다.
주요 특징 및 장점:
- 동일 파일, 이중 출력: 인간은 일반적인 PDF로 보고, LLM은 구조화된 마크다운으로 읽음
- 정보 밀도 향상: 토큰 수는 비슷하거나 약간 증가하지만, 구조 정보가 명확해져 LLM의 추론 정확도 향상
- 낮은 오버헤드: 파일 크기 증가 폭이 매우 낮음 (대부분 한 자릿수 퍼센트 이내)
- 호환성: 주요 오픈소스 PDF 추출 라이브러리에서 해당 속성을 지원함
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.