AI Briefing

APEACH, 크라우드 소싱 기반 혐오 발화 평가 데이터셋 공개

·2022.04.14 00:00

핵심 내용

기존 웹 크롤링 데이터의 편향과 저작권 문제를 해결하기 위해 크라우드 소싱으로 생성된 한국어 혐오 발화 평가 데이터셋 APEACH를 공개했다.

1 / 9

자세히 보기

기존 한국어 혐오 발화 평가 데이터셋은 웹 크롤링에 의존해 주제 편향, 학습 데이터 중복, 저작권 문제가 존재했다. 이를 해결하기 위해 APEACH는 불특정 다수(Crowd)가 직접 문장을 생성하는 방식을 도입했다.

크라우드 소싱 기반 데이터 생성 프로세스

APEACH는 Pseudo Classifier, 데이터 생성 및 피드백, 사후 레이블링의 3단계로 구성된다. 크라우드 워커는 프롬프트에 따라 혐오성 또는 일반 문장을 작성한 뒤, 보조 AI 분류기의 예측 결과와 자신의 의도를 비교하여 레이블을 보정한다. 이후 매니저들이 저작권 위반이나 특정인 지칭 등 크리티컬한 데이터를 걸러내는 사후 레이블링을 수행한다.

기존 데이터셋 대비 장점

BEEP! 등 기존 데이터셋과 비교한 결과, APEACH는 커뮤니티 구어체뿐 아니라 문어체나 정중한 형태의 차별 표현까지 포괄한다. 또한 사전학습 데이터 도메인(KcBERT vs SoongsilBERT)에 따른 성능 편차가 적어, 모델 평가의 공정성을 높인다. Pycon KR의 행동 강령을 참고해 10가지 카테고리로 프롬프트를 구성했으며, 개인정보 보호를 위해 고유명사 사용을 제한했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.