AI Briefing

Leviathan, 에이전트용 로컬 로그 인덱서 공개

Leviathan: 대용량 티켓과 로그를 grep 대신 수백 토큰의 검색 결과로 에이전트에 건네는 로컬 인덱서

·2026.10.10 11:30

핵심 내용

100만 건 데이터에서 grep 대비 컨텍스트 토큰을 99% 절감하며 hit@1 98.5%의 정확도를 달성했다.

1 / 5

자세히 보기

Rust 기반 단일 바이너리 도구 Leviathan이 공개되었습니다. JSONL, CSV, SQLite 등 대용량 데이터를 SQLite FTS5 인덱스로 변환하여, 임베딩 없이 BM25 어휘 검색으로 AI 에이전트에 수백 토큰 분량의 압축된 검색 결과만 전달합니다.

성능 및 효율성

개발자가 공개한 100만 건 합성 데이터 벤치마크 결과, Leviathan은 grep 방식 대비 에이전트 컨텍스트 사용량을 극적으로 줄였습니다.

  • 토큰 효율성: 100만 건 데이터 기준, grep 전체 이력 사용 시 209,412 토큰이 소모되지만 Leviathan은 436 토큰으로 약 99% 절감했습니다.
  • 검색 정확도: hit@1 98.5%, **hit@5 99.0%**를 기록하여 grep 기반 방식(96.0%, 83.0%)보다 높은 정확도를 보였습니다.
  • 지연 시간: 100만 건 데이터 검색 시 p50 지연 시간은 33.4ms입니다.

특징 및 제한 사항

  • 경량화: 네트워크나 DB 접속 정보 없이 로컬에서 실행되며, 런타임 의존성이 없습니다. 인덱스 크기는 원본의 약 1.8배입니다.
  • 에이전트 연동: Claude Skills나 MCP 서버(leviathan mcp)를 통해 search, get 등 4개 읽기 전용 도구로 연동할 수 있습니다.
  • 한국어 지원: 기본 porter unicode61 토크나이저는 한국어 형태소 분석을 지원하지 않아 조사 처리에 제약이 있습니다. 실험적으로 형태소 분석기를 활용한 보조 필드 생성이 가능합니다.
  • 데이터 특성: 특정 대상에 기록이 많은 구조(설비 정비 기록 등)에 최적화되었으며, 현재 v0.1.0 초기 단계입니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.