AI Briefing

RAG 컨텍스트를 실제 답변에 필요한 내용으로만 압축하기

·2026.07.07 04:28

소형 LLM을 활용해 RAG 컨텍스트의 68%를 제거하면서도 재현율 96%를 유지하는 기술을 소개한다.

RAG(Retrieval-Augmented Generation) 파이프라인에서 리트리버가 가져온 수많은 청크 중 상당수는 실제 답변 생성에 불필요한 노이즈입니다. 이러한 노이즈는 비용 증가컨텍스트 낭비를 초래합니다.

Kapa는 이를 해결하기 위해 리트리버와 생성 모델(Generator) 사이에 소형 LLM을 활용한 Pruning(가지치기) 단계를 추가했습니다. 이 방식의 핵심 성과는 다음과 같습니다.

  • 비용 절감: 쿼리당 비용을 약 1/3 수준으로 낮춤
  • 효율성: 컨텍스트의 68%를 제거하면서도 96%의 재현율(Recall) 유지
  • 정확도: 단순한 Rerank 점수 기반 컷오프가 아닌, 청크 간의 관계를 파악하는 방식을 채택

기존의 Reranker는 각 청크를 개별적으로 점수 매기는 Pointwise 방식이기에, 청크 간의 상호 관계나 전체 맥락에서의 중요도를 반영하지 못한다는 한계가 있습니다. Kapa는 이를 극복하여 답변에 꼭 필요한 정보만을 선별함으로써 에이전트의 컨텍스트 공간을 확보하고 추론 효율을 극대화했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.