AI Briefing

ProvenanceGuard, MCP 에이전트 출처 귀속 검증

Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents

·2026.09.29 22:07

핵심 내용

Multiverse Computing이 MCP 에이전트용 검증 레이어 ProvenanceGuard를 공개했다.

1 / 4

자세히 보기

Multiverse Computing이 **Model Context Protocol(MCP)**을 사용하는 LLM 에이전트에서 발생하는 교차 출처 혼동(cross-source conflation) 문제를 해결하기 위한 생성 후 검증 레이어 ProvenanceGuard를 공개했다. 기존 충실성 검증기가 증거를 통합하는 방식과 달리, ProvenanceGuard는 출처의 고유성을 유지하여 주장이 올바른 도구 출력에 귀속되도록 보장한다. 이를 통해 사실은 맞지만 잘못된 출처를 인용하는 상황을 방지한다.

작동 방식

이 시스템은 재학습 없이 캡처된 트레이스를 분석하는 MCP 에이전트 주위의 블랙박스 래퍼로 작동한다. 5단계 파이프라인을 실행한다:

  • 분해(Decomposition): 에이전트의 답변을 구체적인 주장으로 분해한다.
  • 라우팅(Routing): MiniLM을 사용하여 각 주장과 가장 관련성 높은 출처를 식별한다.
  • 지지 확인(Support Check): DeBERTa NLI 검증기로 출처가 실제로 주장을 지지하는지 확인한다.
  • 귀속 확인(Attribution Check): 지지를 제공하는 출처와 답변에서 명시되거나 암시된 출처를 비교한다.
  • 결정(Decision): 주장별 판정과 전역 허용/차단 결정을 내리며, 차단된 답변에 대해 선택적으로 RARR 스타일 복구를 수행한다.

성능 지표

환자 기록과 연구 기사를 사용하는 의료 에이전트 테스트에서 ProvenanceGuard는 미지지 주장을 차단하는 데 높은 정확도를 보였다:

  • 차단 정확도: 인간 전문가가 미지지하다고 판단한 주장 139개 중 138개를 잡아냈으며, 오탐지는 1건에 불과했다.
  • 출처 식별: 출처를 식별할 수 있는 주장의 **86%**에 대해 올바른 지지 출처를 정확히 식별했다.
  • 비교: 주장 기각/차단에서 0.802 F1 점수를 기록하며, MiniCheck(0.783), RAGAS Faithfulness(0.758), AlignScore(0.662), SummaC-ZS(0.436) 등 출처를 무시하는 기준선 모델들을 능가했다.
  • 귀속 스왑: 명명된 출처를 교체한 통제된 테스트에서 잘못된 귀속을 100% 감지했다.

한계 및 통합

효과적이지만, 유사한 문서가 여러 개 있는 스트레스 테스트에서는 정확한 출처 식별률이 **50.3%**에 그쳐 매우 유사한 출처를 구분하는 데 어려움을 겪는다. 로컬 구성에서 검증 오버헤드는 답변당 약 0.5초다. 이 접근법은 이미 NVIDIA NVFlow에 금융 에이전트를 위한 선택적 근거 검증 단계로 통합되어, 민감하고 데이터가 많은 환경에서의 적용 가능성을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.