게스트 여정 학습을 통한 Airbnb 검색 개인화
·2026.07.22 02:01
Airbnb가 수년간의 게스트 행동 데이터를 Transformer 시퀀스 모델로 학습해 검색 랭킹을 개인화하는 시스템을 구축했다.
Airbnb 검색 랭킹은 오랫동안 총 예약 횟수나 평균 숙소 가격 같은 집계 통계 기반의 수작업 피처에 의존해왔다. 피처 수가 수백 개로 늘어나면서 확장성과 표현력 모두 한계에 달했고, 이를 해결하기 위해 Transformer 기반 시퀀스 모델을 도입했다.
게스트 시퀀스는 두 파트로 분리해 설계했다. 장기 시퀀스는 최근 7년간의 예약, 리뷰, 취소 등 빈도가 낮지만 정보량이 높은 이벤트를 최대 80개 캡처하고, 단기 시퀀스는 최근 21일간의 숙소 조회 이벤트를 최대 200개 캡처한다. 두 임계값은 전체 시퀀스 중 가장 긴 2%만 잘리도록 설정됐다.
학습 효율화를 위해 세 가지 전략을 적용해 학습 처리량을 약 4배 향상시켰다. 핵심은 검색 배치 처리로, causal mask를 활용해 인코더를 한 번만 실행하면서 여러 검색에 대한 시퀀스 임베딩을 동시에 추출한다.
- 고카디널리티 ID(숙소·호스트 식별자, 지리적 계층 ID)는 통합 임베딩 테이블로 공유 처리
- 숙소 조회처럼 희소한 예약 신호와 노이즈 많은 브라우징 신호를 함께 다루는 것이 소셜 미디어 참여 모델링과 구별되는 핵심 과제
- 수억 개의 검색-레이블 쌍 학습 비용을 줄이기 위한 targeted optimization 적용
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.