사이트맵과 robots.txt, 무엇을 먼저 손봐야 하나
한 줄 요약
robots.txt를 먼저 확인하고, 사이트맵은 그 다음에 손본다. robots.txt에서 크롤러 접근이 막혀 있으면 사이트맵을 아무리 잘 만들어도 검색엔진이 페이지를 읽지 못한다. 지역 병원·학원·매장은 AI 크롤러 차단 여부부터 점검해야 한다.
robots.txt와 사이트맵 중 무엇을 먼저 확인해야 하나
robots.txt를 먼저 확인한다. robots.txt는 검색엔진과 AI 크롤러가 사이트에 접근할 수 있는지를 결정하는 파일이다. 여기서 접근이 막혀 있으면 사이트맵이 아무리 잘 만들어져 있어도 크롤러가 페이지를 읽지 못한다.
사이트맵은 크롤러에게 "어떤 페이지를 읽어야 하는지" 알려주는 목록이다. robots.txt가 문을 여는 열쇠라면, 사이트맵은 안내 지도다. 문이 잠겨 있으면 지도는 소용없다.
지역 병원·학원·매장 사이트는 제작 업체가 기본 설정으로 만들어준 경우가 많다. 이때 robots.txt에서 특정 크롤러를 차단하는 설정이 들어 있는지 모르고 지나치는 경우가 있다. AI 검색에 내 사업장이 안 나온다면 이 파일부터 확인해야 한다.
robots.txt에서 AI 크롤러 차단 여부를 어떻게 확인하나
브라우저 주소창에 내도메인.com/robots.txt를 입력한다. 파일이 열리면 Disallow 항목을 찾는다. 이 항목에 /가 적혀 있거나, GPTBot, ClaudeBot, PerplexityBot, Google-Extended 같은 이름이 명시돼 있으면 해당 크롤러가 차단된 것이다.
User-agent: GPTBot
Disallow: /
위 설정은 ChatGPT의 크롤러인 GPTBot이 사이트 전체를 읽지 못하게 막는다. 이 상태에서는 ChatGPT가 내 사이트를 인용할 수 없다.
확인해야 할 크롤러는 네 가지다.
- GPTBot: ChatGPT
- ClaudeBot: Claude
- PerplexityBot: Perplexity
- Google-Extended: Gemini
이 중 하나라도 Disallow: /로 막혀 있으면 해당 AI 검색에서 내 사이트가 인용되지 않는다. 제작 업체나 호스팅 업체에 연락해 해당 줄을 삭제하거나 Allow: /로 바꿔달라고 요청한다.
사이트맵은 언제 만들어야 하나
robots.txt에서 크롤러 접근이 확인된 뒤에 사이트맵을 점검한다. 사이트맵은 sitemap.xml 파일로 만들어지며, 크롤러에게 "이 페이지들을 읽어주세요"라고 알려주는 목록이다.
지역 병원·학원·매장 사이트는 페이지 수가 많지 않다. 보통 홈, 소개, 진료·수업 안내, 공지사항, 오시는 길 정도다. 이 정도 규모라면 사이트맵이 없어도 크롤러가 모든 페이지를 찾아낼 수 있다. 하지만 사이트맵이 있으면 크롤러가 더 빠르게 페이지를 인덱싱한다.
사이트맵이 있는지 확인하려면 내도메인.com/sitemap.xml을 브라우저에 입력한다. 파일이 열리면 이미 만들어져 있는 것이다. 파일이 없으면 제작 업체에 요청하거나, 워드프레스·카페24 같은 플랫폼을 쓴다면 플러그인이나 관리자 설정에서 자동 생성 기능을 켠다.
사이트맵에 어떤 페이지를 넣어야 하나
사이트맵에는 검색 결과에 노출되길 원하는 페이지만 넣는다. 지역 사업장 기준으로 다음 페이지는 반드시 포함한다.
- 홈페이지
- 진료·수업·상품 안내 페이지
- 의료진·강사·대표 소개
- 공지사항·블로그 최신 글
- 오시는 길·예약 안내
반대로 다음 페이지는 사이트맵에서 제외한다.
- 로그인·회원가입 페이지
- 관리자 페이지
- 중복된 내용의 페이지
- 임시 저장 글
사이트맵에 불필요한 페이지가 많으면 크롤러가 중요한 페이지를 놓칠 수 있다. 제작 업체에 "검색 결과에 나와야 할 페이지만 사이트맵에 넣어달라"고 요청한다.
robots.txt와 사이트맵을 수정한 뒤 확인하는 법
robots.txt를 수정했다면 Google Search Console에서 URL 검사 도구를 사용해 크롤링이 허용됐는지 확인한다. 사이트맵을 수정했다면 Search Console의 "사이트맵" 메뉴에서 sitemap.xml 주소를 제출한다.
제출 후 며칠 안에 "성공" 상태로 바뀌면 정상이다. 오류가 뜨면 사이트맵 파일 형식이 잘못됐거나, robots.txt에서 사이트맵 경로가 막혀 있을 수 있다.
AI 크롤러 접근 여부는 무료 진단에서 확인할 수 있다. GPTBot, ClaudeBot 등 네 가지 크롤러가 내 사이트를 읽을 수 있는지 등급으로 보여준다.
두 파일을 손본 뒤 언제 효과가 나타나나
robots.txt를 수정하면 크롤러가 다음 방문 때부터 바로 적용한다. 보통 며칠에서 2주 안에 변화가 감지된다. 사이트맵을 제출하면 Search Console에서 인덱싱 상태를 확인할 수 있으며, 역시 1~2주 안에 반영된다.
AI 검색 인용 비율은 더 오래 걸린다. 크롤러가 페이지를 읽고, AI 모델이 학습 데이터에 반영하고, 실제 답변에 인용되기까지 수주에서 수개월이 걸릴 수 있다. 지금 손보는 것은 몇 달 뒤를 위한 준비다.
지역 사업장은 페이지 수가 적고 업데이트가 자주 일어나지 않는다. 그래서 한 번 제대로 설정해두면 오래 유지된다. robots.txt와 사이트맵은 분기마다 한 번씩 점검하면 충분하다.
자주 묻는 질문
robots.txt에서 모든 크롤러를 허용하면 보안 문제가 생기나
일반 크롤러를 허용하는 것만으로는 보안 문제가 생기지 않는다. robots.txt는 크롤러에게 "읽지 말아달라"고 요청하는 파일일 뿐, 실제 접근을 막는 기술적 장치가 아니다. 관리자 페이지나 개인정보가 담긴 페이지는 로그인 인증으로 보호해야 한다.
사이트맵을 여러 개 만들 수 있나
가능하다. 페이지 수가 5만 개를 넘거나, 페이지 유형별로 관리하고 싶을 때 사이트맵을 나눠 만든다. 예를 들어 블로그 글은 sitemap-blog.xml, 진료 안내는 sitemap-service.xml로 분리할 수 있다. 각 사이트맵 주소를 robots.txt에 명시하거나 Search Console에 개별 제출한다.
AI 크롤러를 허용했는데도 AI 검색에 안 나오는 이유는 무엇인가
크롤러 접근 허용은 첫 단계일 뿐이다. AI가 내 사이트를 인용하려면 페이지 내용이 명확하고, 질문에 대한 답이 단정적으로 적혀 있어야 한다. 또한 경쟁 사이트보다 정보가 구체적이고 신뢰할 만해야 한다. robots.txt를 고쳤다면 이제 페이지 내용을 점검할 차례다.