DocVQA용 대규모 데이터셋 Docmatix 공개
Docmatix - a huge dataset for Document Visual Question Answering
HuggingFace가 기존 대비 240배 규모인 240만 개의 이미지와 950만 개의 Q/A 쌍을 포함한 DocVQA 데이터셋 Docmatix를 공개했다.
HuggingFace가 Document Visual Question Answering(DocVQA)을 위한 대규모 데이터셋인 Docmatix를 공개했다. 이 데이터셋은 130만 개의 PDF 문서로부터 추출된 240만 개의 이미지와 950만 개의 질의응답(Q/A) 쌍을 포함하며, 기존 데이터셋 규모보다 약 240배 더 크다.
Docmatix는 PDFA 데이터셋의 텍스트를 기반으로 Phi-3-small 모델을 사용하여 Q/A 쌍을 생성했다. 데이터 품질을 높이기 위해 정규 표현식과 특정 키워드 필터링을 적용하여 환각 현상이 나타난 데이터의 15%를 제거하는 과정을 거쳤다.
성능 테스트 결과, Docmatix를 활용해 Florence-2 모델을 미세 조정했을 때 DocVQA 성능이 약 20% 향상되었다. 특히 0.7B 파라미터 규모의 Florence-2 모델이 Docmatix 학습을 통해 8B 규모의 Idefics2 모델 성능에 근접하는 결과를 보여, 데이터 규모가 모델 성능에 미치는 강력한 영향력을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.