추천GOT-OCR2.0: 통합 엔드투엔드 OCR 모델 공개
GOT-OCR2.0: 문서와 수식, 표, 악보를 하나의 모델로 인식하는 End-to-End OCR 모델
·2026.07.26 18:30
수식, 표, 악보 등 복잡한 시각 정보를 하나의 모델로 처리하는 엔드투엔드 OCR 모델 GOT-OCR2.0이 공개되었습니다.
기존의 OCR 방식(OCR-1.0)은 텍스트 검출, 인식, 레이아웃 분석 등 여러 모듈을 결합하는 파이프라인 구조로 인해 모듈 간 오류가 누적되는 한계가 있었습니다.
GOT-OCR2.0은 이를 해결하기 위해 모든 광학 신호를 하나의 '문자(character)'로 정의하고 처리하는 엔드투엔드(End-to-End) 모델을 제안합니다. 5.8억(580M) 개의 파라미터를 가진 단일 모델이 이미지에서 직접 텍스트를 추출합니다.
주요 특징 및 기능:
- 다양한 형식 지원: 평문 텍스트는 물론 수식(LaTeX), 분자식(SMILES), 표(Markdown), 악보, 차트, 기하 도형 등을 통합 인식합니다.
- 구조적 특징: 고압축 인코더(High-compression Encoder)와 롱컨텍스트 디코더(Long-context Decoder) 구조를 채택하여, 정보량이 많은 문서 이미지를 효율적으로 처리합니다.
- 유연한 출력: 프롬프트 조절만으로 단순 텍스트 또는 서식이 포함된 구조적 데이터를 생성할 수 있습니다.
- 세밀한 제어: 특정 좌표(Box)나 색상(Color)을 지정하여 이미지의 특정 영역만 인식하는 대화형 OCR 기능을 지원합니다.
이 모델은 중국과학원대학(UCAS) 연구진이 개발하였으며, 가중치와 학습 코드가 모두 공개되어 있습니다. 또한 2025년 2월부터 Hugging Face Transformers 라이브러리에 병합되어 배치 추론이 가능합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.