AI Briefing

Two-Tower를 넘어: 차세대 광고 경량 랭킹 모델을 위한 서빙 스택 재설계

·2026.02.03 02:01

광고 랭킹 모델의 표현력을 높이기 위해 기존 Two-Tower 구조를 탈피하고 GPU 기반의 새로운 서빙 아키텍처를 구축했다.

기존 광고 추천 시스템의 표준인 Two-Tower 모델은 연산 효율성은 뛰어나지만, 사용자-아이템 간의 복잡한 interaction featurestarget attention 같은 고차원적인 특징을 모델링하는 데 한계가 있었다.

이를 해결하기 위해 더 복잡한 신경망을 직접 모델링할 수 있는 GPU 기반 모델 추론 단계를 도입하기로 결정했다. 하지만 기존의 최적화된 서빙 스택에 무거운 GPU 추론을 추가할 경우 발생하는 latency(지연 시간) 문제를 해결하는 것이 핵심 과제였다.

팀은 지연 시간을 최소화하기 위해 서빙 파이프라인을 전면 재설계했다. 특히 Feature Fetching 단계의 병목을 줄이기 위해 다음과 같은 Inventory Segmentation Strategy를 도입했다.

  • Segment 1 (고가치 후보군):1M(100만 개) 규모의 고수익 후보군에 대해서는 특징(feature)을 PyTorch 모델 파일 내에 registered buffers로 직접 포함시켰다. 이를 통해 네트워크 I/O와 Host-to-GPU 데이터 전송을 완전히 제거하고, 특징 데이터를 GPU의 **HBM(High-Bandwidth Memory)**에 상주시켜 처리 속도를 극대화했다.
  • Segment 2 (롱테일 후보군):1B(10억 개) 규모의 나머지 후보군에 대해서는 고성능 Key-Value Store와 인호스트(in-host) 캐싱을 결합하여 특징을 가져오는 방식을 사용한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.