Ground truth는 데이터셋이 아닌 프로세스다
·2026.06.04 00:56
Amazon은 AI 모델이 벤치마크에 도전하고 인간이 이를 검증하는 'audit-then-score' 프로토콜을 통해 평가 정확도를 90.9%로 높였다.
기존 AI 성능 측정 방식은 인간 전문가가 라벨링한 고정된 데이터셋을 ground truth로 삼아 모델을 평가한다. 하지만 복잡한 연구 보고서를 검증하는 작업에서는 PhD급 전문가조차 정답을 맞히는 정확도가 60.8%에 그칠 정도로 기존 방식은 한계가 명확하다.
AI 모델이 벤치마크와 다른 결과를 내놓을 때, 이를 단순한 모델의 오류로 치부하기보다 벤치마크 자체가 불완전하거나 잘못되었을 가능성에 주목해야 한다. 이를 해결하기 위해 Amazon AGI 그룹은 audit-then-score 프로토콜을 제안했다.
audit-then-score 프로토콜은 다음과 같이 작동한다:
- AI 팩트 체커가 기존 벤치마크와 다른 의견을 제시할 경우, 구체적인 증거와 논거를 제출하며 도전한다.
- 인간 전문가(Auditor)는 모델이 제시한 새로운 증거와 기존 벤치마크의 논거를 직접 비교한다.
- 모델의 논거가 더 타당할 경우 벤치마크를 수정하여 모델을 다시 평가한다.
이 프로토콜은 공유 테스트 세트인 DeepFact-Bench와 문헌 지원 여부를 확인하는 DeepFact-Eval 시스템을 포함한다. 이 방식을 적용한 결과, 벤치마크 정확도는 기존 60.8%에서 90.9%로 대폭 향상되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.