AI Briefing

RTL PDF 문서 파싱

·2026.01.22 22:06

핵심 내용

Word Shape Encoding으로 Hebrew·Arabic PDF 파싱 품질을 크게 끌어올렸다.

1 / 2

자세히 보기

기존 PDF 파서들은 Hebrew와 Arabic 같은 RTL(right-to-left) 언어에서 레이아웃을 자주 무너뜨리고, 텍스트를 잘못 읽거나 환각까지 일으켰다. 특히 RAG 파이프라인에서는 파싱 품질이 곧 입력 품질이어서, 이 격차가 실제 고객 데이터 활용을 막는 문제로 이어졌다.

문제를 풀기 위해 저자들은 OmniDocBench를 기준으로 한 Hebrew 데이터셋을 새로 만들고, MonkeyOCR 기반 전처리와 수동 검증을 거쳐 문서 구조, 읽기 순서, 배치를 정밀하게 태깅했다. 목표는 RTL 문서를 억지로 새 모델에 맞추는 것이 아니라, 이미 강한 LTR(왼쪽→오른쪽) 파서의 능력을 그대로 활용하는 것이었다.

핵심 해법은 Word Shape Encoding이다. 먼저 영어 단어들을 Arial 10pt로 렌더링해 너비와 높이를 측정한 뒤, 이를 기반으로 오프라인 shape-to-word index를 만든다. 이후 RTL 문서의 각 단어를 bounding box 크기와 유사한 영어 단어로 KNN 매핑하고, 표준화된 영어 형태의 PDF로 재렌더링한다.

이 과정은 두 단계로 완성된다.

  • Text substitution: RTL 단어를 대응하는 영어 단어로 바꾸되, 글꼴 크기, bold, italic 같은 스타일은 유지한다.
  • Spatial mirroring: 페이지의 가로 좌표를 뒤집어 모든 텍스트, 이미지, 벡터 그래픽을 LTR 기준으로 재배치한다.

이렇게 만든 “영어처럼 보이는” PDF를 일반 파서에 넣은 뒤, Markdown 출력과 원래 매핑을 이용해 다시 원문 단어로 되돌린다. 복원 단계에서는 정확히 같은 단어가 아니어도 Levenshtein distance로 가장 가까운 후보를 찾아 원래 Hebrew 의미를 재구성한다.

평가는 여러 계열의 파서에서 진행됐다. VLM으로는 GPT-4o, Gemini 3.0, Qwen2.5-VL을, 모듈형 파이프라인으로는 MinerU와 Marker를, 상용 SaaS로는 LLaMaParse와 Apryse를 비교했다. 지표는 문단 텍스트의 edit distance 기반 정확도와 표 구조까지 보는 Table-TEDS였고, 결과는 특히 표 파싱에서 큰 개선을 보였다.

RTL 언어 전체에 동일한 효과가 나타난 것은 아니었다. Arabic에서는 GPT-4o-mini가 개선됐지만 GPT-4.1은 오히려 떨어졌고, 저자들은 이를 모델의 RTL 처리 능력보다 언어 노출량 차이로 해석했다. 이를 확인하기 위해 같은 입력을 여러 번 파싱한 뒤 출력 간 평균 유사도를 보는 self-consistency를 측정했고, 덜 확신하는 언어·모델 조합일수록 이 방식의 효과가 더 크게 나타났다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.