5개의 프론티어 LLM, 1,000개의 실제 팩트체크 항목 중 67%에서 서로 다른 답변 제시
·2026.05.28 21:20
5개의 최상위 LLM이 실제 팩트체크 데이터 1,000건을 분석한 결과, 67%의 항목에서 모델 간 의견이 불일치했다.
Lenz Research의 연구 결과, 5개의 프론티어 LLM이 1,000개의 실제 사용자 팩트체크 요청을 검토했을 때 67%의 사례에서 모델 간 의견이 일치하지 않는 것으로 나타났다.
주요 분석 결과는 다음과 같다:
- 67%의 불일치: 1,000건 중 672건에서 다수결 의견과 다른 모델이 존재하거나, 명확한 다수결이 형성되지 않았다.
- 34%의 실질적 격차: 343건의 경우, 모델 간 답변 범주(True, Mostly True, Misleading, False) 차이가 2단계 이상 벌어지는 심각한 의견 차이를 보였다.
- 제한적인 합의 수준: Krippendorff's $\alpha$ (ordinal) 지수는 0.639로, 모델들이 무작위로 답변하지는 않지만 하나의 통합된 판단 기준으로 삼기에는 부족한 수준이다.
모델들의 판단 패턴을 살펴보면, 'True'와 'False' 같은 양극단의 명확한 판결에서는 의견이 모이는 경향이 있었으나, 'Mostly True'와 'Misleading' 같은 중간 범주에서는 의견이 크게 갈렸다. 또한, 일부 모델은 답변을 양극단에 집중시키는 반면, 다른 모델들은 중간 범주에 답변을 넓게 분산시키는 특징을 보였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.