웹 페이지 토큰 71% 절감하는 추출 방식
Measuring information density in web pages from an LLM agent's perspective [R]
구조적 HTML 추출로 LLM 에이전트의 토큰 사용량을 71.5% 절감하면서 답변 품질을 유지할 수 있다는 연구 결과가 발표되었다.
RAG 및 에이전트 시스템 최적화를 위해 100개의 웹 페이지를 대상으로 단순 HTML-to-text 방식과 구조적 추출(Structural Extraction) 방식을 비교 실험했다. 구조적 추출은 시맨틱 HTML 태그와 DOM 서브트리의 텍스트 및 링크 밀도를 활용한다.
실험 결과, 구조적 추출 방식은 평균 71.5%의 토큰 감소 효과를 나타냈다. 카테고리별 감소율은 다음과 같다:
- 뉴스: 65.5%
- 이커머스: 62.5%
- 문서(Docs): 46.3%
- SaaS 마케팅: 45.9%
- 소셜 미디어: 30.7%
LLM-as-judge(Qwen2.5-7B)를 통한 검증 결과, 콘텐츠 보존 점수는 77.7/100을 기록했다. 답변 품질(Answer Quality Delta) 측면에서 베이스라인과 대등한 수준을 유지하여, 토큰 비용을 약 28.5% 수준으로 낮추면서도 품질 저하 없이 효율적인 처리가 가능함을 입증했다.
한편, Anthropic의 Claude Code가 내부적으로 WebFetch 시 Haiku 모델을 사용하여 웹 데이터를 압축하는 단계가 있음이 확인되었다. 이는 공식 문서에 없는 동작으로, Claude Code를 활용해 벤치마킹을 진행할 경우 도구 자체의 성능이 아닌 Anthropic의 압축 레이어가 결과에 영향을 줄 수 있음에 유의해야 한다.
관련 코드와 방법론은 GitHub의 sentinel 레포지토리에서 확인할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.