AI Briefing

[CVPR 2026] 텍스트를 넘어: VinQA가 멀티모달 문서 QA 응답에 시각적 요소를 통합하는 방법 - LG AI Research BLOG

·2026.07.20 17:00

LG AI Research가 텍스트와 시각적 요소를 전략적으로 결합해 답변을 생성하는 VinQA 연구를 발표했다.

기존의 멀티모달 문서 QA 연구는 문서 전체를 입력하거나 RAG를 통해 관련 페이지를 검색하더라도 최종 답변을 텍스트로만 생성한다는 한계가 있었다.

LG AI Research는 이를 해결하기 위해 VinQA를 제안했다. VinQA는 단순히 이미지를 답변 끝에 붙이는 것이 아니라, 설명하는 문장 바로 앞에 관련 도표나 차트를 배치하는 시각적 요소가 통합된 긴 답변(Long-form answer) 생성을 목표로 한다.

VinQA의 주요 특징은 다음과 같다:

  • VinQA 데이터셋: 학술 논문, 웹사이트, 교과서 등 7개 도메인을 아우르는 대규모 데이터셋을 구축했다. 학습 데이터는 약 13만 페이지, 42,700개의 QA로 구성된다.
  • 멀티모달 RAG 기반: 멀티모달 RAG 파이프라인을 통해 검색된 컨텍스트를 바탕으로, 텍스트와 시각적 인용이 결합된 답변을 생성한다.
  • 두 가지 인코딩 방식: 페이지 전체의 레이아웃을 보존하는 Page Encoding과 시각적 요소를 추출하여 처리하는 Modality Encoding 방식을 통해 모델의 이해도를 높였다.

이번 연구는 CVPR 2026에서 발표되었으며, 실제 문서 환경에서 시각적 자료가 답변의 명확성을 어떻게 높일 수 있는지에 대한 새로운 방향성을 제시한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.