마켓컬리, AWS SageMaker Ground Truth로 후기 이미지 분류 자동화 및 훈련 데이터 구축기
핵심 내용
마켓컬리가 후기 이미지 분류 모델 개선을 위해 AWS SageMaker Ground Truth를 도입해 10만 장 규모의 훈련 데이터를 구축한 사례를 공유했다.
자세히 보기
마켓컬리는 고객 후기 이미지 분류 자동화를 위해 머신러닝 모델을 운영 중이며, 도입 1년 만에 스크린샷 후기 비율을 약 10%에서 1%대로 낮췄다. 하지만 추가 훈련 없이 운영되면서 오분류 개선 요구가 발생했고, 이를 해결하기 위해 훈련 데이터 준비 과정을 재검토했다.
훈련 데이터 준비의 어려움과 초기 방법
후기 이미지는 S3에 일자별로 저장되며 매일 6~8,000개씩 업로드된다. 초기에는 hashlib을 이용해 중복 이미지를 제거하고, PIL을 통해 손상된 이미지를 필터링했다. 분류 방식으로는 Finder 미리보기 기능을 활용한 드래그 앤 드롭(약 1시간/1만 장)과 커맨드 라인 분류기(약 1시간 10분/1만 장)를 사용했으나, 데이터량이 10만 장 규모로 커지자 파인더 멈춤 현상 등으로 인해 비효율적이었다.
AWS SageMaker Ground Truth 도입 및 비용 분석
대안으로 AWS SageMaker Ground Truth를 검토한 결과, 자동 분류 알고리즘의 유효성은 낮다고 판단해 지정 인력을 통한 수작업 분류 방식을 선택했다. Ground Truth는 매니페스트 파일 생성과 작업자 화면 설정을 지원하며, 프라이빗 테넌트 옵션을 통해 내부 인력이나 외부 업체를 활용할 수 있다.
하지만 비용 측면에서는 한계가 드러났다. AWS 외주 분류 시 10만 장 기준 약 1,200달러(약 150만 원)가 예상되는 반면, 국내 인력(시급 1만 원 가정)으로 10만 장을 처리하려면 약 600만 원이 소요되어 Ground Truth가 비용 효율적으로 보였다. 그러나 Ground Truth의 프라이빗 라벨링도 10만 개당 약 400달러(약 50만 원)의 수수료가 부과되어, 대규모 데이터 처리 시 여전히 높은 비용 부담이 발생했다. 결국 Ground Truth의 편리함에도 불구하고 비용 문제로 인해 대안 모색이 필요한 상황이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.