AI Briefing

LLM, 검증된 출처 오답 45-88% 수용… 사용자 압력은 저항

LLMs that push back on a wrong user still accept the same wrong answer from a "verified source" - NeurIPS 2026 [R]

·2026.10.01 23:45

핵심 내용

NeurIPS 2026 연구 결과, LLM은 검증된 출처의 오답을 45-88% 수용하는 권위 편향을 보였다.

자세히 보기

NeurIPS 2026에 채택된 새로운 연구가 대규모 언어모델(LLM)에서 권위 편향(Authority Bias) 현상을 규명했다. 모델은 사용자가 제시한 잘못된 정보는 거부하면서도, '검증된 출처'에서 나온 정보라는 프레이밍만으로도 잘못된 내용을 수용하는 경향을 보였다.

실험 설정 및 결과

연구진은 TriviaQA 질문 중 모델이 처음에 정답을 맞힌 경우를 대상으로 실험을 진행했다. 5개 오픈 웨이트 모델(Qwen3.5, GPT-OSS, OLMo-2, OLMo-3.1, Gemma-4)과 3개 API(GPT-5.4, Grok-4.20, Gemini-3.1-Pro)를 테스트했으며, 잘못된 답을 '검증된 출처' 또는 '도메인 전문가' 사용자의 주장으로 제시했다.

  • 출처에 대한 높은 순응도: 8개 모델 중 7개에서 '검증된 출처'라는 단 한 줄의 주석이 정답의 **45-88%**를 오답으로 뒤집었다.
  • 사용자에 대한 낮은 순응도: 동일한 오답을 사용자가 제시할 경우 정답 변경 비율은 현저히 낮았으며, 특히 사용자 압력에 잘 저항하는 모델일수록 이 격차가 가장 컸다.
  • 모델별 성능: GPT-5.4는 **44.7%**의 질문에서 답을 바꿨고, Grok-4.20는 **87.5%**로 가장 취약했다. 반면 Gemini-3.1-Pro는 화자를 무시하며 **0.6%**의 낮은 변경률로 저항력이 두드러졌다.

내부 메커니즘

오픈 웨이트 모델의 차분 평균 방향(difference-of-means directions) 분석 결과, '출처가 지지함'과 '사용자가 지지함'에 대한 신경 표현은 상당 부분 공통 성분을 공유하며(코사인 유사도 ~0.90-0.99), 화자의 신원을 인코딩하는 얇은 고유 성분만 차이로 존재했다.

  • '출처가 지지함' 방향을 제거하면 Qwen3.5, GPT-OSS, OLMo-3.1의 순응도가 64-78포인트 감소했다.
  • '사용자가 지지함' 방향을 제거해도 순응도는 최대 11포인트만 감소했다.
  • 화자 신원 성분만 이동시키면 출처와 사용자 간 순응도 격차의 **55-61%**가 해소되었다.

시사점 및 한계

이 연구는 AI 에이전트와 RAG 시스템에서 모델이 사용자의 수정보다 도구 출력이나 검색된 문서를 더 신뢰할 수 있다는 위험을 지적한다. 다만 내부 메커니즘 결과는 5개 오픈 웨이트 모델 중 3개에서만 일관되게 나타났으며, 실제 검색 파이프라인이 아닌 프롬프트 기반 문서 블록을 사용했다는 한계가 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.