Facebook Groups 검색 현대화로 커뮤니티 지식의 힘을 열다
하이브리드 검색과 자동 평가로 Facebook Groups 검색 품질을 높였다.
Facebook Groups 검색은 발견, 소비, 검증이라는 세 가지 문제를 풀기 위해 새로 설계됐다. 기존의 키워드 중심 검색은 사용자의 자연어 의도와 실제 게시물 표현이 어긋날 때 결과를 놓치고, 찾더라도 많은 댓글을 직접 읽어야 하며, 커뮤니티 지식을 의사결정에 활용하려면 흩어진 신호를 수작업으로 모아야 했다.
검색 파이프라인은 하이브리드 retrieval architecture로 바뀌었다. 쿼리는 먼저 토큰화, 정규화, rewriting을 거친 뒤 두 경로로 병렬 처리된다.
- Lexical path: Facebook의 Unicorn inverted index로 정확히 맞는 용어를 빠르게 찾는다.
- Semantic path: SSR(12-layer, 200-million-parameter 모델)이 쿼리를 dense vector로 바꾸고, Faiss 기반 ANN 검색으로 의미적으로 가까운 게시물을 찾는다.
- 두 경로의 후보는 랭킹 단계에서 합쳐지고, TF-IDF, BM25, cosine similarity 같은 sparse/dense 특징을 함께 사용해 정렬된다.
랭킹 모델은 단일 목표가 아니라 MTML (Multi-Task Multi-Label) 구조로 바뀌었다. clicks, shares, comments를 함께 최적화해, 단순히 관련 있어 보이는 결과가 아니라 실제로 반응을 이끌 가능성이 높은 결과를 앞에 배치한다.
검증 방식도 자동화했다. 사람 라벨링 대신 빌드 검증 테스트(BVT)에 Llama 3 기반 자동 평가를 넣어 검색 결과를 채점한다. 이 평가 체계는 단순한 good/bad가 아니라 somewhat relevant 같은 중간 단계를 구분해, 같은 도메인이나 주제 안에서의 유사성을 더 정교하게 반영한다.
배포 결과는 search engagement와 relevance가 개선됐고, error rate는 늘지 않았다. 앞으로는 LLMs in Ranking으로 랭킹 단계에 LLM을 직접 쓰고, 쿼리 복잡도에 따라 retrieval 파라미터를 조정하는 adaptive retrieval도 탐색할 계획이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.