AI Briefing

RAG 평가, 지금 방식은 틀렸다

·2025.04.07 18:49

RAG 평가는 점수보다 현실의 문서 관계를 봐야 한다.

RAG 평가는 지금의 평가 기준이 실제 사용 환경을 제대로 반영하지 못한다고 지적한다. 문서를 어떻게 나누느냐부터 검색 품질이 갈리는데, 기존 평가는 이 핵심 결정을 빼놓은 채 점수만 비교하는 경우가 많다.

대표적인 함정은 문서 분할이다. 크게 나누면 맥락을 살리지만 세부가 희미해지고, 너무 잘게 쪼개면 사실은 잘 잡아도 이야기 흐름이 깨진다. 평가 점수만 잘 나오는 설정과 실제 서비스에서 잘 작동하는 설정은 서로 다를 수 있다.

또 다른 문제는 답이 문서 한 곳에 깔끔하게 존재한다는 가정이다. 실제 정보는 여러 문서에 흩어져 있고, 때로는 관계와 빈도, 전체 맥락을 함께 읽어야만 답이 나온다. 예로 Seinfeld 팬에게 조지의 별칭은 Art Vandelay지만, 답은 한 문장이 아니라 여러 에피소드에 쌓인 맥락 속에서 드러난다.

그래서 RAG 평가는 다음을 따져야 한다.

  • 문서 분할을 얼마나 잘 처리하는지
  • 흩어진 정보를 얼마나 잘 엮는지
  • 문서 간 관계를 이해하는지
  • 세부보다 큰 그림을 놓치지 않는지

AI21 LabsNiv Granot 팀이 본 것처럼, 평가 점수만 높여도 실제 사용자는 만족하지 않을 수 있다. Microsoft의 GraphRAG 같은 접근은 단순 텍스트 분할을 넘어서는 방향을 보여주지만, 평가 기준 자체를 현실에 맞게 바꾸지 않으면 같은 실패를 반복하게 된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.