AI Briefing

GPT 모델 안전성 훈련이 성차별을 줄이는 것이 아니라 변형시킨다는 연구 발표

·2026.09.19 13:07

핵심 내용

GPT-2부터 GPT-5까지 분석한 연구에서 안전성 훈련이 성차별을 제거하기보다 변형시키는 '해세탁(harm laundering)' 현상을 확인했다.

자세히 보기

EMNLP 26 Main Conference에 채택된 연구는 GPT-2부터 GPT-5까지 OpenAI의 15개 모델을 분석하여, 기존 안전성 평가 방식이 성차별적 내용을 제거하는 것이 아니라 변형시키는 'harm laundering' 현상을 놓치고 있음을 밝혔다.

연구팀은 45만 건의 성별 지향적 출력 데이터를 분석하여 다음과 같은 패턴을 발견했다.

  • 차별 내용의 변형: GPT-2 여성 대상 출력에서 흔했던 성폭력 관련 클러스터는 GPT-4에서 사라졌으나, 이는 차별의 감소가 아닌 형태 변형으로 나타났다.
  • 대표성 격차: 남성 대상 출력은 돌봄, 감정 표현, 동맹 정체성 등 긍정적 대표 영역을 획득한 반면, 여성 대상 출력은 그렇지 못했다.
  • GPT-5의 사례: GPT-5에서는 유방암을 남성 권리 논쟁으로 프레이밍하는 주제(Topic 5)가 발견되었으나, 3가지 독립적인 분류기는 이를 비독성(non-toxic)으로 평가했다.

또한, GPT-4 정렬 경계에서 여성 대상 출력의 주제 다양성이 남성 대비 36% 감소했으며, REGARD 지표로 측정한 대표성 해악 격차는 모델 릴리스 날짜와 양의 상관관계(ρ = +0.55)를 보인 반면 Detoxify 점수는 유의미한 상관관계가 없었다(ρ = -0.23). 연구팀은 독성 점수 감소가 해악 감소의 충분 조건이 아님을 강조하며, 모든 생성형 모델에 적용 가능한 3단계 감지 프로토콜을 제시했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.