RAG를 위한 이미지 인덱싱 방법
·2026.06.03 01:13
핵심 내용
RAG 시스템의 비용 효율성을 위해 인덱싱 단계에서 이미지를 텍스트로 설명하여 저장하는 방식을 제안한다.
1 / 2
자세히 보기
기술 문서 내 스크린샷, 다이어그램, 표를 RAG(Retrieval-Augmented Generation) 파이프라인에서 효율적으로 활용하는 엔지니어링 접근법을 다룬다.
가장 일반적인 방식인 쿼리 시점 멀티모달(Query-time multimodal) 방식은 관련 이미지를 모두 수집해 비전 모델에 전달하지만, 경제성이 매우 낮다. 실제 테스트 결과 이미지를 직접 전달할 경우 쿼리당 비용이 **GPT는 27%, Claude는 51%**까지 증가하는 것으로 나타났다.
이를 해결하기 위해 인덱싱 시점에 이미지를 텍스트로 설명하는 방식을 사용한다.
- 인덱싱 단계: 저렴한 비전 모델을 사용하여 각 이미지의 내용을 한 번만 텍스트로 기술한다.
- 저장 및 검색: 생성된 설명을 일반 텍스트 청크와 함께 저장하고, 쿼리 시에는 이 텍스트를 검색하여 모델에 전달한다.
이 접근법을 적용하면 텍스트 전용 방식 대비 쿼리당 오버헤드를 1%~6% 수준으로 최소화하면서도, 답변의 품질을 통계적으로 유의미하게 높일 수 있다. 특히 사용자가 특정 설정을 찾는 과정을 시각적 맥락과 함께 제공함으로써 답변의 **실행 가능성(actionability)**을 크게 개선한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.