olmOCR, 비즈니스용 OCR 엔진으로 파인튜닝
Finetuning olmOCR to be a faithful OCR-Engine
·2025.04.23 03:33
비즈니스 문서의 헤더와 푸터를 누락 없이 추출하도록 olmOCR을 파인튜닝하는 방법과 결과를 공유한다.
Allen Institute의 olmOCR은 LLM 학습 데이터 생성을 목적으로 설계되어, 문서의 헤더와 푸터 같은 부가 정보를 의도적으로 제외하는 특성이 있다. 이는 인보이스(송장)와 같이 문서의 모든 정보가 중요한 비즈니스 애플리케이션에서는 치명적인 한계로 작용한다.
TNG는 이러한 문제를 해결하기 위해 olmOCR-7B-0225-preview 모델을 파인튜닝하여, 모든 정보를 충실히 추출하는 OCR 엔진을 개발했다.
주요 기술 및 방법론:
- 데이터셋 생성: Qwen2.5-VL-72B-Instruct를 사용하여 헤더와 푸터 정보를 포함한 8,000개의 고품질 문서 데이터셋을 구축했다.
- 학습 환경: 8xH100 Nvidia 노드에서 오픈 소스 olmOCR 파이프라인을 사용하여 2.5 에폭 동안 학습을 진행했다.
- 추론 전략: document anchoring 기술을 활용하여, 텍스트 블록의 위치 정보와 원본 텍스트를 VLM 프롬프트에 함께 전달함으로써 문서의 구조적 맥락을 유지한다.
결과: 실험 결과, 기존 olmOCR이 무시하던 문서 상·하단의 핵심 정보를 파인튜닝된 모델은 정확하게 추출해 내는 것을 확인했다. 이를 통해 단순 학습 데이터 생성을 넘어 실제 비즈니스 워크플로우에 적용 가능한 수준의 OCR 성능을 확보했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.