DocVQA용 대규모 데이터셋 Docmatix 공개
Docmatix - a huge dataset for Document Visual Question Answering
·2024.07.18 09:00
핵심 내용
HuggingFace가 기존 대비 240배 규모인 240만 개의 이미지와 950만 개의 Q/A 쌍을 포함한 DocVQA 데이터셋 Docmatix를 공개했다.
1 / 2
자세히 보기
HuggingFace가 Document Visual Question Answering(DocVQA)을 위한 대규모 데이터셋인 Docmatix를 공개했다. 이 데이터셋은 130만 개의 PDF 문서로부터 추출된 240만 개의 이미지와 950만 개의 질의응답(Q/A) 쌍을 포함하며, 기존 데이터셋 규모보다 약 240배 더 크다.
Docmatix는 PDFA 데이터셋의 텍스트를 기반으로 Phi-3-small 모델을 사용하여 Q/A 쌍을 생성했다. 데이터 품질을 높이기 위해 정규 표현식과 특정 키워드 필터링을 적용하여 환각 현상이 나타난 데이터의 15%를 제거하는 과정을 거쳤다.
성능 테스트 결과, Docmatix를 활용해 Florence-2 모델을 미세 조정했을 때 DocVQA 성능이 약 20% 향상되었다. 특히 0.7B 파라미터 규모의 Florence-2 모델이 Docmatix 학습을 통해 8B 규모의 Idefics2 모델 성능에 근접하는 결과를 보여, 데이터 규모가 모델 성능에 미치는 강력한 영향력을 입증했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.