AI Briefing

실제 팩트체크에서 프런티어 LLM 간 불일치

·2026.05.29 09:33

5종의 프런티어 LLM이 실제 클레임 팩트체크 시 67%의 사례에서 서로 다른 판정을 내리는 것으로 나타났다.

1,000개의 실제 사용자 클레임을 대상으로 5종의 프런티어 LLM을 분석한 결과, 67%의 사례에서 모델 간 판정이 일치하지 않는 것으로 나타났습니다. 모든 모델이 동일한 판정을 내린 경우는 33%에 불과했습니다.

주요 분석 결과:

  • 실질적 불일치: 4단계 루브릭(True, Mostly True, Misleading, False) 기준으로 2칸 이상 차이가 나는 '실질적 불일치'는 **34%**였으며, True와 False로 극단적으로 갈린 경우는 **21%**에 달했습니다.
  • 모델 간 일치율: 모델 쌍별 라벨 일치율은 53%~75% 사이였습니다. 동일 기반 모델인 Gemini 3 Pro와 Search 버전 간의 일치율이 75%로 가장 높았습니다.
  • 모델별 판정 경향: 모델마다 성향 차이가 뚜렷했습니다. Gemini 3 Pro는 True(54%) 판정 비중이 매우 높았던 반면, Claude Opus 4.7은 중간 단계(Mostly True, Misleading)를 더 빈번하게 사용하는 경향을 보였습니다.

이번 연구는 정답 라벨 없이 모델 간의 판정 구조를 분석함으로써, LLM의 정확도 자체보다 판정 결과의 구조적 불안정성을 드러내는 데 중점을 두었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.