AI Briefing

RAG를 위한 이미지 인덱싱 방법

·2026.06.03 01:13

RAG 시스템의 비용 효율성을 위해 인덱싱 단계에서 이미지를 텍스트로 설명하여 저장하는 방식을 제안한다.

기술 문서 내 스크린샷, 다이어그램, 표를 RAG(Retrieval-Augmented Generation) 파이프라인에서 효율적으로 활용하는 엔지니어링 접근법을 다룬다.

가장 일반적인 방식인 쿼리 시점 멀티모달(Query-time multimodal) 방식은 관련 이미지를 모두 수집해 비전 모델에 전달하지만, 경제성이 매우 낮다. 실제 테스트 결과 이미지를 직접 전달할 경우 쿼리당 비용이 **GPT는 27%, Claude는 51%**까지 증가하는 것으로 나타났다.

이를 해결하기 위해 인덱싱 시점에 이미지를 텍스트로 설명하는 방식을 사용한다.

  • 인덱싱 단계: 저렴한 비전 모델을 사용하여 각 이미지의 내용을 한 번만 텍스트로 기술한다.
  • 저장 및 검색: 생성된 설명을 일반 텍스트 청크와 함께 저장하고, 쿼리 시에는 이 텍스트를 검색하여 모델에 전달한다.

이 접근법을 적용하면 텍스트 전용 방식 대비 쿼리당 오버헤드를 1%~6% 수준으로 최소화하면서도, 답변의 품질을 통계적으로 유의미하게 높일 수 있다. 특히 사용자가 특정 설정을 찾는 과정을 시각적 맥락과 함께 제공함으로써 답변의 **실행 가능성(actionability)**을 크게 개선한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.