AI Briefing

카카오, 협업 필터링 모델 선택 시 고려해야 할 3가지 핵심 기준 제시

·2021.10.18 00:00

핵심 내용

피드백 데이터 종류, 최적화 목표, 편향 문제를 고려해 Matrix Factorization, BPR 등 모델을 선택해야 함을 설명한다.

1 / 4

자세히 보기

카카오 추천팀은 협업 필터링(CF) 모델을 개발할 때 모델 자체보다 '해결할 문제'를 먼저 정의해야 한다고 강조한다. 충분한 피드백 데이터 유무, 추천 구좌 크기, 예측 정확도 대 랭킹 최적화 등 상황에 따라 적합한 모델이 다르기 때문이다.

피드백 데이터의 특성에 따른 모델 선택

CF 모델은 유저-아이템 상호작용 데이터를 활용한다. Explicit Feedback(평점 등)이 풍부한 경우와 Implicit Feedback(클릭, 체류 시간 등)만 있는 경우 접근 방식이 다르다. 특히 Implicit Feedback은 유저가 소비하지 않은 아이템을 싫어하는지 단순히 노출되지 않았는지 알 수 없는 불확실성이 존재한다. 이를 해결하기 위해 Alternating Least Squares(ALS) 모델은 Confidence 개념을 도입해 관찰되지 않은 데이터의 불확실성을 학습에 반영한다.

최적화 목표에 따른 학습 프레임워크

점수 예측인지 랭킹 최적화인지에 따라 모델이 달라진다. 일반적인 Point-wise 손실 함수 대신 랭킹 성능이 중요한 경우 **Bayesian Personalized Ranking(BPR)**과 같은 Pair-wise 학습 프레임워크가 유리하다. BPR은 긍정/부정 아이템 쌍을 비교하여 AUC를 직접 최적화함으로써 기존 기법 대비 우수한 랭킹 성능을 제공한다.

데이터 편향 및 피드백 루프 대응

추천 시스템의 학습 데이터는 통제된 실험이 아닌 관찰 데이터로, 노출 편향(Selection Bias)과 피드백 루프 문제가 존재한다. 이는 기존 모델에 유리한 오프라인 평가(nDCG 등)로 이어질 수 있다. 랜덤 데이터 수집은 사용자 경험 저하로 제한적이므로, 편향된 데이터에서도 공정한 평가를 위한 Debiasing 방법론 연구가 진행되고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.