LLM 상호 평가 시 모델 제품군별 편향성 발견
I had 55 LLMs blind-grade each other (22k judgments, all open). Every model family with enough data is biased toward its own siblings. Qwen judges favor Qwen by ~0.9 points. Mistral penalizes its own by ~1.0.
·2026.06.28 09:10
55개 LLM을 대상으로 한 대규모 상호 채점 결과, 모델 제품군에 따른 유의미한 평가 편향이 확인되었다.
55개의 모델과 11개의 개발사 제품군을 대상으로 22,254건의 블라인드 채점을 수행한 결과, 모델 제품군 내에서 통계적으로 유의미한 **자기 제품군 편향(In-group bias)**이 발견되었습니다.
주요 관찰 사항은 다음과 같습니다:
- 긍정적 편향: Qwen 모델은 자사 모델에 약 +0.9점, xAI는 +0.75점, Anthropic은 +0.62점의 가산점을 부여했습니다.
- 부정적 편향: Mistral 모델은 자사 모델에 대해 -1.02점을 부여하며 가장 큰 폭의 부정적 편향을 보였고, Meta(-0.68)와 Google(-0.59) 역시 자사 모델에 부정적인 경향을 나타냈습니다.
- 평가 불일치: 모델 간 평가 불일치는 코드(Code) 영역에서 가장 높게 나타났으며, 이는 메타 정렬(Meta-alignment) 평가보다 약 2배 더 높은 수치입니다.
- 결론: 단일 모델 기반의 리더보드는 실제 성능을 왜곡할 수 있으며, 코드와 수학 영역에서는 실행 테스트(Test suite)를 병행한 검증이 필수적입니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.