도메인 전문가의 지식을 인코딩하다: Spotify 데이터 어시스턴트 뒤에 숨겨진 컨텍스트 레이어
·2026.06.10 22:01
Spotify는 방대한 데이터셋 속에서 정확한 인사이트를 제공하기 위해 도메인 전문가의 지식을 결합한 컨텍스트 레이어 기반의 AI 데이터 어시스턴트를 구축했다.
Spotify는 수만 개의 데이터셋과 페타바이트급 데이터 규모로 인해 발생하는 데이터 접근 병목 현상을 해결하고자 AI 데이터 어시스턴트를 개발했다. 단순히 모든 스키마를 LLM에 넣는 방식은 컨텍스트 윈도우의 한계와 데이터의 실제 의미(Semantics)를 파악하지 못한다는 문제점이 있었다.
이를 해결하기 위해 Spotify는 데이터 도메인을 클러스터(Cluster) 단위로 관리하며, 각 클러스터는 도메인 전문가가 직접 관리하는 세 가지 핵심 요소로 구성된다.
- Datasets: 스키마, 컬럼 카디널리티, 샘플 값, 파티션 구조를 포함한 데이터 웨어하우스 테이블 정보
- Pairs: 전문가가 검증한 '질문-SQL' 쌍으로, LLM에 데이터 쿼리 패턴과 의미를 학습시키는 Few-shot 메커니즘 역할
- Docs: 용어 정의, 주의 사항, 팀별로 상이한 비즈니스 컨텍스트 등 추가 정보
이 어시스턴트는 ReAct 루프를 따라 추론과 실행을 반복하며, 사용자가 Slack, IDE(MCP 서버), 웹 UI를 통해 자연어로 질문하면 SQL을 생성하고 실행하여 결과와 함께 쿼리 및 출처를 제공한다. 이러한 구조를 통해 모델의 답변에 대한 **신뢰성(Trustworthiness)**과 투명성을 확보했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.