Synthetic Data로 빠른 Multilingual OCR Model 만들기
핵심 내용
합성 데이터 1,220만 장으로 6개 언어 OCR을 빠르고 정확하게 학습했다.
자세히 보기
Nemotron OCR v1의 병목은 아키텍처가 아니라 데이터였다. CJK와 키릴 문자를 충분히 보지 못해 일본어, 한국어, 러시아어, 중국어에서 NED가 0.56~0.92까지 치솟았다.
해결책은 합성 데이터 파이프라인이다. mOSCAR에서 언어별 원문을 뽑고, SynthDoG를 크게 수정해 단어·문장·문단 단위의 bounding box와 4-point quad, 그리고 reading order relation graph까지 생성했다.
레이아웃도 단순 문서가 아니다.
- 멀티컬럼 본문
- 흩어진 scene-text 스타일
- 세로쓰기
- 표, 목차, 슬라이드, 워드문서형 페이지
언어별 글꼴은 165~1,258개까지 확보했고, 테두리·그림자·노이즈·블러·모폴로지·색상 변형 등 강한 augmentation을 걸어 현실감을 높였다.
최종 데이터는 12.2M 샘플 규모이며, 6개 언어를 커버한다.
- English: 1,825,089
- Japanese: 1,889,137
- Korean: 2,269,540
- Russian: 1,724,733
- Chinese (Simplified): 2,335,343
- Chinese (Traditional): 2,214,304
모델인 Nemotron OCR v2는 detector, recognizer, relational model의 3단 구조다. 핵심은 공유 backbone이다. RegNetX-8GF가 이미지를 한 번만 처리하고, 그 특징을 인식기와 관계 모델이 재사용해 속도를 끌어올렸다.
성능은 합성 벤치마크에서 크게 개선됐다. multilingual 모델은 일본어 0.046, 한국어 0.047, 러시아어 0.043, 중국어 간체 0.035, 중국어 번체 0.065의 NED를 기록했다. 실제 문서 벤치마크 OmniDocBench에서도 34.7 pages/s를 내며 PaddleOCR v5보다 28배 이상 빠르다고 밝혔다.
데이터셋은 nvidia/OCR-Synthetic-Multilingual-v1, 모델은 nvidia/nemotron-ocr-v2로 공개됐고, dataset은 CC-BY-4.0, model은 NVIDIA Open Model License다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.