AI Briefing

AI에게 도메인을 가르치기 위한 두 번의 시행착오 — LLM Wiki와 RAG의 결합

·2026.05.21 00:00

LLM Wiki와 RAG를 결합해 도메인 지식을 효율적으로 전달하는 AI 시스템 구축 과정을 공유한다.

도메인 지식을 잘 이해하는 '시니어 AI'를 만들기 위해 LLM Wiki 패턴과 RAG를 결합하는 시도를 진행했다.

첫 번째 단계인 Inverted Index 방식은 키워드 기반 색인을 사용했으나, 동의어 처리 미흡과 무관한 문서 참조로 인해 토큰 효율과 정확도가 낮았다.

두 번째 단계인 본문 임베딩 방식은 의미 기반 검색을 가능케 했으나, 다음과 같은 한계에 부딪혔다.

  • 의미 평균화: 다주제 문서의 벡터가 모호해져 검색 품질 저하
  • 약어 검색 취약: 사내 약어나 식별자(ID)에 대한 인식 부족
  • Truncation: 임베딩 모델의 입력 제한으로 인한 정보 손실

최종적으로 요약 임베딩과 **본문 FTS(Full-Text Search)**를 분업하는 구조로 개선했다.

  • 의미 매칭: LLM이 생성한 짧은 요약본을 임베딩하여 검색 정확도 향상
  • 키워드 매칭: SQLite FTS5를 활용해 약어와 식별자를 정확히 검색

이 과정은 단순히 모델에 의존하는 것이 아니라, AI가 이해하기 좋은 형태로 지식을 재정리하고 사람과 도구 간의 역할을 분담하는 과정이었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.