AI 에이전트의 프라이버시 위협, MosaicLeaks
MosaicLeaks: Can your research agent keep a secret?
·2026.06.19 03:13
AI 리서치 에이전트의 외부 쿼리가 민감한 정보를 유출하는 '모자이크 효과'를 규명하고 해결책을 제시한다.
AI 리서치 에이전트가 개인 문서를 참조하여 외부 도구(웹 검색 등)를 사용할 때, 개별 쿼리는 무해해 보이지만 이들을 조합하면 민감한 정보가 드러나는 **'모자이크 효과(Mosaic Effect)'**가 발생할 수 있음이 확인되었습니다.
연구진은 이를 측정하기 위해 MosaicLeaks라는 새로운 태스크를 제안했습니다. 이 태스크는 에이전트가 민감한 정보를 포함한 질문에 답하기 위해 수행하는 웹 쿼리 로그를 분석하여 세 가지 수준의 유출을 측정합니다:
- Intent leakage: 에이전트가 무엇을 조사하려 하는지 의도를 파악함
- Answer leakage: 쿼리 로그만으로 민감한 질문에 대한 답을 도출함
- Full-information leakage: 질문 없이도 쿼리 로그 조합만으로 민감한 사실을 알아냄
실험 결과, 기존 모델들은 성능 최적화 과정에서 오히려 정보 유출이 심화되는 경향을 보였습니다. 이에 연구진은 **PA-DR(Privacy-Aware Deep Research)**라는 강화학습(RL) 훈련 방법을 제안하여, 작업 성공률은 **58.7%**로 높이면서도 전체 정보 유출(Full-information leakage)은 34.0%에서 9.9%로 크게 낮추는 성과를 거두었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.