AI Briefing

여기어때, Langfuse와 FastMCP로 사내 지식 Agentic RAG 운영 및 평가 체계 구축

·2026.10.10 09:01

핵심 내용

LLM-as-a-judge와 MCP 명세 최적화로 정확도 3~9%p 개선 및 사내 3개 서비스에 적용했다.

1 / 6

자세히 보기

여기어때 공통플랫폼개발팀은 사내 지식 기반 Agentic RAG 시스템의 관측성과 운영 안정성을 확보하기 위해 Langfuse와 FastMCP를 도입한 사례를 공개했다. 단순 검색 기능을 넘어, 답변의 정확도를 검증하고 에이전트가 도구를 효과적으로 사용하도록 유도하는 파이프라인을 구축하는 데 초점을 맞췄다.

LLM 관측 및 평가 파이프라인 구축

LLM과 RAG 시스템은 자연어 출력 특성상 성능 판단이 어렵고 비용 추적이 불투명하다. 이를 해결하기 위해 오픈소스 관측 플랫폼 Langfuse를 도입해 프롬프트, 응답, 토큰 사용량, 비용을 trace 단위로 기록하고 모니터링한다. 평가는 검색 지표(Recall@5, Hit Rate, MRR)와 LLM-as-a-judge를 결합한 이중 구조로 설계했다. 검색 지표는 리트리버의 문서 회수 능력을 확인하고, LLM-as-a-judge는 생성된 답변의 정확도를 0에서 1 사이의 점수로 채점한다. 특히 심판 모델이 정답표를 들고 채점하도록 해 점수의 안정성을 높였다.

FastMCP 서빙과 도구 오케스트레이션

에이전트에게 검색 도구를 제공하기 위해 FastMCP를 사용하며, HTTP Streamable transport 방식을 채택해 권한 관리를 서버 측으로 집중했다. 에이전트가 의도한 검색 흐름(의미 기반 검색 → 관계망 탐색 → 내용 읽기)을 따르도록 MCP Protocol의 초기화 단계에서 서버 instructions를 전달하는 방식을 적용했다. 이를 통해 에이전트가 도구 호출 순서를 무시하고 즉답하는 문제를 방지했다.

명세 최적화를 통한 성능 개선

검색 로직 변경 없이 MCP 명세(instructions, docstring, 파라미터)만 최적화해 정확도를 개선했다. 경량 모델일수록 긴 프롬프트의 중간부 지시를 놓치는 'lost in the middle' 현상이 강해, 중복 지시를 제거하고 프롬프트를 간결하게 유지했다. 또한, 한 번에 여러 문서를 받던 방식을 하나씩 처리하도록 변경하고, 경로 기반 식별자를 고유 ID로 교체해 모델의 해석 오류를 줄였다. 이러한 명세 다듬기만으로 정확도가 3~9%p 상승했으며, 불필요한 왕복 호출이 줄어 토큰 사용량도 절감됐다.

사내 서비스 적용 현황

구축된 Atlas Retriever MCP는 현재 사내 3개 서비스에 적용되어 운영 중이다. Slack 기반 기술지원봇의 답변 초안 생성, 사내 AI 에이전트 플랫폼 YAPP의 지식 검색 도구, 그리고 개인 개발 환경의 코딩 도구 연동에 활용된다. 전사 Confluence와 Jira 문서를 대상으로 하며, 하루 세 번 증분 업데이트를 통해 최신 지식을 반영한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.