카카오, 유해 이미지 자동 분류 시스템 구축기: 모델 최적화와 인지심리학 기반 라벨링 도구 개발
핵심 내용
수동 검토 부담을 줄이기 위해 스윈 트랜스포머 도입 및 인지심리학 기반 라벨링 도구를 개발해 운영 효율성을 높였다.
자세히 보기
카카오는 급증하는 이미지 콘텐츠에 대한 수동 검토의 한계를 극복하고 판단 일관성을 확보하기 위해 유해 이미지 분류 시스템을 구축했다. 초기에는 유사 이미지 검색과 CNN 기반 분류를 시도했으나, 실제 서비스 환경의 효율성과 정확도를 모두 만족시키기 위해 아키텍처와 운영 도구를 고도화했다.
모델 아키텍처의 진화
초기 탐색 단계에서는 Approximate KNN을 활용해 이미 판정된 유사 이미지를 자동 필터링하며 수동 검토 대상을 줄이는 데 집중했다. 이후 분류 성능을 높이기 위해 Inception-ResNet-v2 등 CNN 모델을 실험했으나, 전역적인 문맥(Global Context) 파악의 한계를 발견했다.
이를 해결하기 위해 Swin Transformer를 도입했다. 윈도우 기반 셀프 어텐션(Window-based Self-Attention)과 Shifted Window 방식을 통해 계산 효율성을 유지하면서도 이미지 전체의 관계를 파악할 수 있었다. 그 결과, 실서버 배포 시에도 예측 성능이 안정적으로 유지되는 **건전성(Robustness)**을 확보했으며, 특히 오탐(False Positive) 사례 감소에 기여했다.
데이터 품질과 라벨링 도구 혁신
모델 성능의 상한선은 데이터 품질에 달려 있다는 판단 아래, 라벨링 프로세스를 대대적으로 개선했다. 먼저 액티브 러닝(Active Learning) 전략을 적용해 모델이 불확실하게 예측한 데이터를 선별적으로 라벨링하도록 했다. 컴퓨팅 자원을 고려해 여러 모델을 앙상블하는 QBC(Query-by-Committee) 대신 **불확실성 샘플링(Uncertainty Sampling)**을 채택해 운영 효율성을 높였다.
또한 인지심리학 원리를 적용해 라벨링 도구의 UI/UX를 재설계했다. 인간 작업 기억의 한계를 고려해 화면 내 불필요한 정보 요소를 제거하고, 이미지 중심의 인터페이스로 변경했다. Grad-CAM을 활용해 AI가 주목한 영역을 시각적으로 강조하고, 유사 이미지와 텍스트 해석 정보를 제공해 라벨러의 판단을 보조함으로써 인지 부하를 줄이고 판단 일관성을 확보했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.