AI Briefing

[CVPR 2026] 텍스트를 넘어, 다이어그램·차트·표 등 문서 속 시각 요소를 활용해 답하는 멀티모달 문서 QA, VinQA

·2026.07.20 17:00

LG AI연구원이 텍스트와 시각 요소를 적절히 배치해 긴 답변을 생성하는 멀티모달 문서 QA 연구 'VinQA'를 발표했다.

기존의 멀티모달 LLM 기반 문서 QA는 답변을 텍스트로만 생성한다는 한계가 있었습니다. 하지만 실제 문서는 다이어그램, 차트, 표 등 다양한 시각 요소가 섞여 있어, 이를 적절히 활용하는 것이 답변의 이해도를 높이는 핵심입니다.

LG AI연구원이 제안하는 VinQA는 단순한 이미지 첨부를 넘어, 근거가 되는 시각 요소를 적절한 위치에 배치하여 Long-Form Answer를 생성하는 연구입니다. 이를 위해 연구팀은 다음과 같은 성과를 거두었습니다.

  • VinQA 데이터셋 구축: 학술 논문, 가이드북 등 7개 도메인에서 약 13만 페이지의 데이터를 재구성하여, 텍스트와 시각 요소가 결합된 긴 답변 데이터셋을 구축했습니다.
  • 두 가지 인코딩 방식 연구: 페이지 전체를 인코딩하는 Page Encoding과 OCR 및 크롭 이미지를 사용하는 Modality Encoding 방식을 비교 연구했습니다.
  • 새로운 평가 프레임워크: 시각 요소의 인용 정확도와 배치 적절성을 측정할 수 있는 M-GroSEVisual G-Eval 등의 평가 지표를 제안했습니다.

실험 결과, 오픈소스 모델인 Qwen2.5-VL-7B를 VinQA 데이터셋으로 파인튜닝했을 때, 상용 모델인 GPT-4.1 및 Claude 3.5 Sonnet과의 성능 격차를 크게 좁히는 성과를 보였습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.