GPTBot·ClaudeBot·PerplexityBot 차이 — 예산 승인 기준
한 줄 요약
GPTBot·ClaudeBot·PerplexityBot은 각각 ChatGPT·Claude·Perplexity가 웹을 읽기 위해 보내는 크롤러다. 셋 모두 robots.txt로 차단 가능하지만, GPTBot은 학습용과 답변용 크롤러가 분리되어 있고, PerplexityBot은 실시간 검색에 특화되어 있으며, ClaudeBot은 학습 목적이 주요하다. 예산을 승인하기 전에 각 크롤러가 우리 사이트를 실제로 읽고 있는지 확인해야 한다.
AI 크롤러는 왜 여러 개인가
ChatGPT·Claude·Gemini·Perplexity는 각각 다른 회사가 운영하는 AI 검색 서비스다. 각 서비스는 웹 페이지를 읽기 위해 자체 크롤러를 보낸다. GPTBot은 OpenAI가, ClaudeBot은 Anthropic이, PerplexityBot은 Perplexity AI가 운영한다. Google-Extended는 구글의 Gemini가 사용한다.
크롤러마다 방문 빈도, 읽는 콘텐츠 범위, 학습 여부가 다르다. 한 크롤러를 허용했다고 해서 다른 AI가 우리 사이트를 인용하는 것은 아니다. 각각 별도로 접근 권한을 설정해야 한다.
예산 승인 단계에서는 "AI 검색 최적화"라는 포괄 항목이 아니라, 어느 크롤러에 우선순위를 둘지 결정해야 한다. 모든 크롤러를 동시에 대응하는 것은 비용 대비 효과가 낮다.
GPTBot은 무엇을 하나
GPTBot은 OpenAI가 운영하는 크롤러다. ChatGPT의 웹 검색 기능과 GPT 모델 학습에 모두 사용된다. GPTBot을 허용하면 ChatGPT가 답변할 때 우리 사이트를 인용할 수 있다.
GPTBot은 학습용 크롤러(ChatGPT-User)와 구분된다. robots.txt에서 GPTBot만 차단하면 실시간 답변에는 인용되지 않지만, 이미 학습된 데이터는 계속 사용된다. 반대로 ChatGPT-User만 차단하면 학습은 막히지만 웹 검색 인용은 가능하다.
대표·임원이 확인할 것은 두 가지다. 첫째, robots.txt에 GPTBot 차단 규칙이 있는지. 둘째, ChatGPT에 우리 브랜드명을 검색했을 때 사이트가 인용되는지. 인용되지 않는다면 크롤러 접근이 막혀 있거나, 콘텐츠가 인용 가치가 낮다고 판단된 것이다.
[무료 진단](#free-check)에서 GPTBot 접근 여부를 즉시 확인할 수 있다.
ClaudeBot은 무엇을 하나
ClaudeBot은 Anthropic의 크롤러다. Claude 모델 학습에 주로 사용되며, 실시간 검색 기능은 제한적이다. ClaudeBot을 허용해도 Claude가 우리 사이트를 즉시 인용하지는 않는다.
ClaudeBot은 학습 목적이 명확하기 때문에, 단기 가시성보다 장기 데이터 제공 여부를 결정해야 한다. 우리 콘텐츠를 AI 학습에 제공할 의사가 없다면 robots.txt에서 차단한다. 제공할 의사가 있다면 허용하되, 당장 트래픽 증가를 기대해서는 안 된다.
Claude는 최근 일부 지역에서 웹 검색 기능을 테스트하고 있지만, ChatGPT·Perplexity만큼 보편화되지 않았다. 예산 우선순위에서 ClaudeBot은 GPTBot·PerplexityBot보다 뒤에 둬야 한다.
PerplexityBot은 무엇을 하나
PerplexityBot은 Perplexity AI의 크롤러다. Perplexity는 실시간 검색 기반 AI 답변 서비스이므로, PerplexityBot은 학습보다 즉시 인용에 집중한다. PerplexityBot을 허용하면 Perplexity 답변에 우리 사이트가 출처로 표시될 가능성이 높다.
PerplexityBot은 방문 빈도가 높다. 사용자가 질문할 때마다 실시간으로 웹을 읽기 때문이다. 서버 부하가 우려된다면 robots.txt의 Crawl-delay 지시어로 방문 간격을 조정할 수 있다.
Perplexity는 출처 링크를 명시하는 구조이므로, 인용되면 직접 유입이 발생한다. ChatGPT보다 트래픽 전환율이 높은 편이다. 예산 승인 시 PerplexityBot 대응은 단기 성과 지표로 삼을 수 있다.
어느 크롤러에 우선순위를 둬야 하나
예산 승인 단계에서는 목표에 따라 우선순위를 정한다. 단기 가시성이 목표라면 GPTBot과 PerplexityBot을 먼저 허용한다. 장기 데이터 제공이 목표라면 ClaudeBot과 Google-Extended를 포함한다.
우선순위를 정하는 기준은 세 가지다. 첫째, 우리 고객이 어느 AI를 주로 사용하는가. 둘째, 각 크롤러가 우리 사이트를 현재 읽고 있는가. 셋째, 인용되었을 때 트래픽 전환이 실제로 일어나는가.
대부분의 사업자는 GPTBot을 1순위로 둔다. ChatGPT 사용자가 가장 많기 때문이다. PerplexityBot은 2순위, Google-Extended는 3순위, ClaudeBot은 4순위가 일반적이다. 하지만 우리 업종에서 Claude 사용 비중이 높다면 순서는 달라진다.
오픈AI 에이전트가 위키피디아 서비스 장애를 일으켰다면, 우리 플랫폼은 무엇을 점검해야 하나 글에서 크롤러 접근으로 인한 서버 부하 점검 방법을 확인할 수 있다.
robots.txt에서 크롤러를 어떻게 구분하나
robots.txt에서 각 크롤러는 User-agent 이름으로 구분된다. GPTBot은 GPTBot, ClaudeBot은 ClaudeBot, PerplexityBot은 PerplexityBot, Google-Extended는 Google-Extended다. 대소문자를 정확히 써야 한다.
특정 크롤러만 차단하려면 아래처럼 작성한다.
User-agent: GPTBot
Disallow: /
모든 AI 크롤러를 차단하려면 각각 별도로 규칙을 추가해야 한다. User-agent: *로 모든 크롤러를 차단하면 구글·네이버 검색 크롤러까지 막히므로 주의한다.
일부 경로만 허용하려면 Disallow와 Allow를 조합한다. 예를 들어 블로그는 허용하고 관리자 페이지는 차단하려면 아래처럼 쓴다.
User-agent: GPTBot
Disallow: /admin/
Allow: /blog/
robots.txt 수정 후 각 AI 서비스에 반영되는 시간은 다르다. GPTBot은 보통 며칠 내, PerplexityBot은 몇 시간 내 반영된다. 변경 후 일주일 뒤 다시 확인해야 한다.
예산 승인 전에 확인할 것
예산을 승인하기 전에 현재 상태를 먼저 측정한다. 각 크롤러가 우리 사이트를 읽고 있는지, 실제로 인용되는지 확인해야 한다. 인용되지 않는 상태에서 콘텐츠 제작 예산을 쓰면 성과가 나오지 않는다.
확인 항목은 네 가지다. 첫째, robots.txt에 AI 크롤러 차단 규칙이 있는가. 둘째, 각 AI 서비스에 브랜드명을 검색했을 때 우리 사이트가 인용되는가. 셋째, 경쟁사는 어느 정도 인용되는가. 넷째, 인용된 페이지는 어떤 구조인가.
Check-X는 GPTBot·ClaudeBot·Google-Extended·PerplexityBot 접근 여부를 측정하고, 100회 질문으로 실제 인용 비율을 집계한다. 경쟁사 인용 기록도 함께 제공하므로, 예산 승인 근거 자료로 쓸 수 있다.
측정 없이 "AI 검색 최적화"라는 항목으로 예산을 편성하면, 어느 크롤러에 투자했는지 사후 검증이 불가능하다. 크롤러별 인용 비율을 분기마다 측정해 예산 집행 방향을 조정해야 한다.
자주 묻는 질문
AI 크롤러를 전부 차단하면 검색 순위가 떨어지나
AI 크롤러를 차단해도 구글·네이버 검색 크롤러는 영향을 받지 않는다. robots.txt에서 GPTBot·ClaudeBot·PerplexityBot만 개별 차단하면 기존 검색 순위는 유지된다. 단, AI 검색 결과에는 인용되지 않으므로 그쪽 유입은 사라진다.
크롤러를 허용했는데 인용이 안 되면 무엇을 확인해야 하나
크롤러 접근이 허용되어 있어도 콘텐츠 구조가 인용에 적합하지 않으면 AI가 답변에 쓰지 않는다. 페이지 제목·본문이 질문-답변 구조인지, 사실 기반 문장이 있는지, 경쟁사 대비 정보 밀도가 높은지 확인한다. 측정 도구로 실제 인용 여부를 주기적으로 점검해야 한다.
AI 크롤러 접근 로그는 어디서 확인하나
서버 접근 로그에서 User-agent 필드를 검색하면 GPTBot·ClaudeBot·PerplexityBot 방문 기록을 확인할 수 있다. 구글 서치 콘솔이나 네이버 서치어드바이저에는 AI 크롤러 통계가 별도로 제공되지 않으므로, 서버 로그를 직접 분석하거나 전용 측정 도구를 사용해야 한다.