점진적 비디오 검색의 개인화: 하이브리드 Text와 ID Embedding
Apple TV가 Text와 ID Embedding을 결합한 개인화 검색으로 짧은 쿼리에서 정확도를 8% 향상시켰다.
점진적 비디오 검색은 각 글자 입력마다 높은 품질의 순위를 지어야 하는데, 1-3글자 접두사로는 사용자 의도가 불분명한 문제가 있다. Apple TV의 개인화 시스템은 의미론적 신호와 협업 신호를 조합해 이를 해결한다.
두 가지 임베딩 모델을 학습한다: (i) TextEmb - 다국어 텍스트 인코더를 co-engagement triplet에서 대조학습으로 파인튜닝, (ii) IdEmb - 사용자-아이템 상호작용 데이터에서 학습한 협업 필터링 기반 임베딩. 추론 시에는 최근 시청 이력에서 사용자 표현을 구성하고, Text와 ID 기반 사용자-아이템 코사인 유사도를 XGBoost 랭커에 입력한다.
오프라인 평가 결과, 사용자 이력이 있는 세션에서 NDCG@10 2.99%, MRR 3.30% 개선됐다. 특히 짧은 쿼리에서 효과가 크다: 1-3글자 모호한 쿼리에서 NDCG@10이 +8.63% 향상된 반면, 더 긴 쿼리에서는 +1.46%에 그쳤다. 사용자 이력이 많을수록 개선폭이 크다—1-5개 이력 사용자는 +2.13%, 51-100개 이력 사용자는 +4.37% 향상.
온라인 A/B 테스트(3주)에서 클릭률 +1.14%, 전환율 +1.23% 달성. 전환된 아이템의 평균 순위도 2.91% 개선됐다. Text와 ID 임베딩 간 trade-off 분석과 LLM 판별을 활용한 임베딩 품질 평가도 포함된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.