AI Briefing

AI 에이전트의 인용 오류: 15.9%가 부적절한 출처

OpenBioRQ: AI Agents Cite Wrong Papers 15.9% of the Time

·2026.06.26 19:19

새로운 벤치마크 OpenBioRQ는 AI 에이전트가 인용하는 논문의 15.9%가 내용과 일치하지 않는 문제를 지적했다.

새로운 벤치마크인 OpenBioRQ는 12개 분야, 12,553개의 미해결 생물 의학 연구 질문을 통해 AI 에이전트의 인용 정확도를 평가했습니다.

연구 결과, 에이전트들이 URL 자체를 지어내는 환각(Hallucination) 현상은 드물었으나(99% 이상의 URL이 유효함), **인용된 논문이 실제 주장과 일치하지 않는 비율이 약 15.9%**에 달하는 것으로 나타났습니다. 이는 단순히 URL의 유효성만 검사하는 기존 평가 방식이 에이전트의 신뢰성을 과대평가할 수 있음을 시사합니다.

주요 관찰 사항은 다음과 같습니다:

  • 모델별 성능 격차: 난도가 높은 질문 세트에서 Gemini-3-Pro, Opus-4.7, GPT-5.5는 29~60%의 해결률을 보인 반면, 오픈 웨이트 모델은 약 17%에 그쳤습니다.
  • 도구 사용 중단 현상: 질문의 난도가 높아질수록 에이전트가 검색 도구(Retrieval tools) 사용을 아예 멈춰버리는 행동적 붕괴(Behavioral collapse) 현상이 관찰되었습니다.
  • 평가 방식의 중요성: 기존의 URL 유효성 검사 방식으로는 에이전트의 실제 논리적 인용 정확도를 측정하기 어렵다는 점이 확인되었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.