AI Briefing

SmithDB의 전체 텍스트 검색: 오브젝트 스토리지용 역색인 설계

·2026.06.11 02:02

SmithDB는 대규모 JSON 페이로드를 가진 에이전트 트레이스를 효율적으로 검색하기 위해 오브젝트 스토리지에 최적화된 역색인 구조를 설계했다.

SmithDB는 대규모의 중첩된 JSON 문서가 오브젝트 스토리지에 저장된 환경에서도 에이전트 트레이스에 대해 400ms(P50)의 중간 지연 시간으로 전체 텍스트 검색(Full-text search) 및 JSON 필터링을 지원한다.

에이전트 트레이스는 기존 로그 데이터와 다른 독특한 특성을 가진다. inputsoutputs 필드가 전체 데이터의 대부분을 차지하며, LLM의 컨텍스트 윈도우가 커짐에 따라 페이로드 크기가 수백 MB까지 늘어나는 경향이 있다. 이로 인해 소스 데이터 대비 인덱스 크기 비율(source:index ratio)이 일반적인 로그(1:1.25)보다 훨씬 높은 1:1.9에 달한다.

SmithDB는 이러한 문제를 해결하기 위해 다음과 같은 설계 원칙을 적용했다.

  • 효율적인 인덱스 구조: 지프의 법칙(Zipfian distribution)을 따르는 토큰 빈도수를 처리하기 위해, 단일 파일 내에서 다양한 빈도의 용어를 압축적으로 저장할 수 있는 구조를 채택했다.
  • 오브젝트 스토리지 최적화: 요청당 지연 시간과 처리량 제한을 고려하여, 불필요한 데이터 읽기를 최소화하도록 스토리지 레이아웃과 쿼리 실행 방식을 설계했다.
  • 다양한 쿼리 모달리티 지원: 특정 경로의 존재 여부를 확인하는 path existence, 특정 값을 찾는 keyed value, 그리고 자유 텍스트를 검색하는 free text 검색을 모두 지원한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.