AI Briefing

고카디널리티(High Cardinality) 상황에서의 쿼리 분석 벤치마킹

·2024.03.16 00:15

LLM을 활용한 쿼리 분석 시 발생하는 고카디널리티 범주형 값 처리 문제와 그 해결 방안을 벤치마킹한다.

LLM을 활용해 데이터를 구조화된 형식으로 변환할 때, 고카디널리티(High Cardinality) 범주형 값(Enums)을 정확히 처리하는 것은 매우 까다로운 과제입니다. 범주형 값이 너무 많으면 LLM이 컨텍스트 내에 모든 값을 담지 못하거나, 비용 및 속도 저하, 추론 능력 저하 문제를 일으키며, 심지어 존재하지 않는 값을 생성(Hallucination)하기도 합니다.

본 연구에서는 이를 테스트하기 위해 **10,000개의 저자 이름과 별칭(Alias)**이 포함된 데이터셋을 구축했습니다. 예를 들어, 사용자가 'Harry Chase'를 검색하면 시스템이 이를 실제 저자인 'Harrison Chase'로 정확히 매핑할 수 있는지 확인하는 방식입니다.

실험은 검색 시스템의 실제 환경을 고려하여 **단일 LLM 호출(Single LLM call)**로 제한하여 진행되었으며, 다음과 같은 요소들을 중점적으로 측정했습니다.

  • 정확도: 별칭을 실제 값으로 올바르게 매핑하는지 여부
  • 지연 시간(Latency): 응답 속도
  • 비용(Cost): 토큰 사용량에 따른 경제성

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.