LLM 판정판이 동의할 때, 우리는 믿을 수 있는가?
·2026.08.27 02:10
핵심 내용
LLM 판정판의 상관관계를 고려한 새로운 집계 방식이 기존 방법보다 정확도를 9~14% 높였다.
자세히 보기
RAG 시스템 평가 시 여러 LLM 판정판이 동일한 답변에 동의한다고 해서 그 결과가 반드시 신뢰할 만한 것은 아니다. 판정판들이 동일한 프롬프트나 학습 계보를 공유하여 동일한 오류를 반복할 수 있기 때문이다.
이 문제를 해결하기 위해 ICML에서 발표된 논문은 Ising 모델을 활용해 판정판 간의 상관관계를 분석하고 이에 따라 집계 점수를 조정하는 방법을 제안한다. 이 방법은 판정판의 개별 신뢰도와 유사성을 동시에 학습하며, 인간 레이블 없이 판정판 출력 데이터만으로 학습이 가능하다.
- 상관관계 조정: 중복된 동의는 할인 처리하여 예측 규칙의 해석 가능성을 유지한다.
- 클래스 의존 모델: 모호한 항목에서 판정판들이 특정한 군집으로 나뉘는 패턴을 포착한다.
3가지 이진 분류 작업(관련성, 독성 등)에서 이 방법은 역사적 정확도 기반 가중치 판정판보다 표준 지표에서 9~14% 높은 성능을 기록했다. 기존 평가 로그에 포함된 동의/불일치 패턴을 활용하여 추가 판정판이 독립적인 증거를 제공하는지 여부를 파악하는 데에도 유용하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.