ChatGPT, Claude, Perplexity, Gemini에 질문하고 Nginx 로그를 관찰해봤다
·2026.04.21 00:22
주요 AI 비서들의 웹 조회 방식과 식별 가능한 User-Agent를 Nginx 로그로 분해했다.
Nginx에 커스텀 로그 포맷을 넣고 ChatGPT, Claude, Perplexity, Gemini 등에게 같은 페이지를 가리키는 질의를 던져, 모델이 원문을 직접 가져오는지와 사용자가 답변을 읽고 클릭해 들어오는지를 분리해 관찰했다.
핵심은 AI 트래픽을 한 덩어리로 보면 안 된다는 점이다.
- Provider-side fetch: 봇/에이전트가 오리진을 직접 읽는 요청
- Real clickthrough visit: 사용자가 답변의 링크를 눌러 들어오는 일반 브라우저 방문
관찰 결과, 일부 서비스는 retrieval 전용 User-Agent를 분명히 남겼다.
- ChatGPT:
ChatGPT-User/1.0 - Claude:
Claude-User/1.0, 그리고 매번robots.txt를 먼저 확인 - Perplexity:
Perplexity-User/1.0 - Meta AI:
meta-webindexer/1.1 - Manus:
Manus-User/1.0
반대로 Gemini는 프롬프트 창 동안 오리진으로 들어온 Google 계열 요청이 없었고, 인덱스에서 답한 것처럼 보였다. Copilot과 Grok은 실제로 페이지를 가져오긴 했지만, 각각 일반 Chrome/Safari 브라우저와 구분되지 않는 형태로 들어와 로그만으로는 AI 방문으로 식별하기 어려웠다.
실무적으로는 다음 결론이 중요하다.
- 로그에서 AI 제공사 fetch와 사람의 클릭 방문을 분리해야 한다.
- Google 계열은 구조적으로 식별이 어려워, Gemini의 live fetch 여부를 HTTP 로그만으로는 구분하기 힘들다.
- 검색 인덱싱 봇(
Googlebot,Bingbot,PerplexityBot,Claude-SearchBot,OAI-SearchBot)과 학습 봇(GPTBot,ClaudeBot,CCBot)은 답변용 retrieval 트래픽과 별개로 봐야 한다.
이 글은 각 벤더의 문서와 로그 관측을 함께 묶어, AI 에이전트의 웹 접근 패턴을 실제 운영 로그에서 어떻게 해석해야 하는지 정리한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.