해석 가능성을 통한 데이터 어노테이터 안전 정책의 이해
·2026.07.06 09:00
데이터 어노테이터의 라벨링 행동을 통해 내부 안전 정책을 학습하고 불일치 원인을 분석하는 APM 모델을 제안한다.
AI 모델 개발의 핵심인 데이터 어노테이션 과정에서 발생하는 의견 불일치는 작업자의 실수(Operational failure), 정책의 모호성(Policy ambiguity), 또는 가치관의 차이(Value pluralism) 등 다양한 원인에서 비롯된다. 하지만 어노테이터에게 직접 이유를 묻는 방식은 비용이 많이 들고, 스스로 답변한 이유가 실제 결정 과정과 다를 수 있다는 한계가 있다.
이를 해결하기 위해 **Annotator Policy Models (APMs)**를 도입한다. APM은 추가적인 설명 요청 없이 오직 라벨링 행동 데이터만을 학습하여 어노테이터의 내부 안전 정책을 해석 가능한 형태로 모델링한다. 이 모델은 80% 이상의 정확도로 어노테이터의 정책을 재현하며, 반사실적 편집(Counterfactual edits)에 대해서도 신뢰할 수 있는 예측 성능을 보인다.
APM은 크게 두 가지 핵심 애플리케이션을 제공한다:
- 정책 모호성 식별: 어노테이터들이 안전 지침을 서로 어떻게 다르게 해석하는지 드러냄
- 가치 다원주의 탐지: 인구통계학적 그룹 간의 안전 우선순위 차이를 체계적으로 파악
이러한 기술은 더욱 정교하고 투명하며, 다양한 관점을 포용할 수 있는 AI 안전 정책 설계에 기여할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.