AI Briefing

LLM의 인간 선호도 시뮬레이션 한계 확인

AI can’t simulate human preferences - new study tests LLMs against thousands of real users

·2026.07.08 04:20

핵심 내용

LLM이 실제 인간의 선택을 예측할 확률은 53%에 불과해 시뮬레이션 도구로서 한계가 있음이 밝혀졌다.

자세히 보기

최근 기업들이 비용 절감을 위해 실제 사용자 대신 **LLM 기반의 '합성 사용자(Synthetic Users)'**를 활용하려는 추세가 있으나, 새로운 연구 결과 이에 대한 회의적인 데이터가 제시되었습니다.

연구진이 28개의 실제 연구 사례와 78개의 선택 과제를 통해 LLM을 테스트한 결과, LLM이 인간의 다수 의견과 일치할 확률은 **53%**에 그쳤습니다. 이는 이진 선택(Two-option) 과제에서 동전 던지기와 다를 바 없는 수준입니다.

주요 연구 결과는 다음과 같습니다:

  • 페르소나 및 CoT의 한계: 상세한 페르소나를 부여하거나 Chain-of-Thought(CoT) 추론을 적용해도 성능 개선 효과는 거의 없었습니다.
  • 정당화의 동질화: 모델의 추론 과정이 오히려 실제 인간의 다양한 경험을 반영하기보다 출력을 **균질화(Homogenize)**하여, 인간의 실제 판단 근거와의 의미적 유사성을 떨어뜨리는 결과가 나타났습니다.
  • 학습 데이터의 특성: LLM은 인간의 선호도를 예측하도록 설계된 것이 아니라, 인간이 선호할 법한 출력물을 재현하도록 학습되었기 때문인 것으로 분석됩니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.