HuggingFace, 문서 이미지 증강 기술 공개
Introducing TextImage Augmentation for Document Images
·2024.08.06 09:00
문서 이미지의 텍스트와 이미지를 동시에 변형하여 VLM 학습 효율을 높이는 멀티모달 데이터 증강 기술을 소개한다.
Vision Language Models(VLM)를 문서 이미지 데이터셋에 미세 조정할 때, 텍스트와 이미지 간의 상호작용을 유지하며 데이터를 증강하는 것이 필수적이다.
Albumentations AI와 협력하여 개발된 TextImage Augmentation 파이프라인은 이미지와 텍스트 어노테이션을 동시에 수정하는 멀티모달(Multimodal) 방식의 증강 기술을 제공한다.
주요 기능은 다음과 같다:
- 텍스트 삽입: 임의의 텍스트를 이미지 위에 오버레이하여 합성 데이터를 생성한다.
- 텍스트 변형: 무작위 삭제(Random deletion), 단어 교체(Random swapping), 불용어 삽입(Stop words insertion) 등을 통해 텍스트의 의미적 유사성을 유지하며 변형한다.
이 기술은 텍스트의 무결성을 보존하면서도 시각적으로 왜곡된 이미지를 생성함으로써, 모델이 제한된 데이터셋 환경에서도 텍스트를 정확하게 읽을 수 있도록 돕는다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.