GEO 핵심 전략

robots.txt와 AI 크롤러: 병원이 몰랐던 차단 문제

A
ACI 리서치팀
| 2025. 04. 18 | 읽기 약 7분 | 조회 1,089

AI 크롤러의 정체

ChatGPT, Perplexity, Claude, Google AI Overview 등의 AI 검색 시스템은 웹의 콘텐츠를 직접 크롤링해 학습 데이터 또는 실시간 검색 결과에 반영합니다. 이 크롤러들은 전통적인 검색 엔진 봇(Googlebot, Bingbot)과는 별개의 User-Agent를 사용하며, 기존 SEO 설정이 이들을 차단하는 경우가 빈번합니다.

2023년 이후 주요 AI 기업들이 공식 발표한 크롤러 현황을 살펴보면, OpenAI는 GPTBot과 ChatGPT 플러그인 검색용 ChatGPT-User를 운영합니다. Perplexity AI는 PerplexityBot을 운영하며, Anthropic(Claude 제조사)은 ClaudeBotClaude-Web을 사용합니다. Google은 AI Overview 데이터 수집을 위해 Google-Extended를 별도로 운영하며, Meta AI는 FacebookBot과 함께 Meta-ExternalAgent를 사용합니다.

이 크롤러들이 중요한 이유는 단순합니다. 크롤러가 페이지에 접근하지 못하면, AI는 해당 콘텐츠를 절대 인용할 수 없습니다. 아무리 훌륭한 GEO 최적화 작업을 해도, robots.txt에서 AI 크롤러를 차단하고 있다면 모든 노력이 물거품이 됩니다.

중요: AI 크롤러를 robots.txt에서 차단하면 AI 학습 데이터에서도 제외되고, 실시간 검색 답변에서도 인용되지 않습니다. 현재 병원 웹사이트의 robots.txt를 즉시 확인하세요. 브라우저에서 "yoursite.co.kr/robots.txt"에 접속하면 내용을 확인할 수 있습니다.

robots.txt 차단이 AI 인용을 막는 방법

robots.txt는 웹 크롤러에게 어느 페이지를 크롤링해도 되는지, 하지 말아야 하는지를 알려주는 텍스트 파일입니다. 병원 사이트에서 AI 크롤러 차단이 발생하는 가장 흔한 패턴 두 가지가 있습니다.

네이버 블로그의 전면 차단 사례

네이버 블로그(blog.naver.com)의 robots.txt는 PerplexityBot, GPTBot, ClaudeBot 등 주요 AI 크롤러를 기본적으로 차단하는 설정을 가지고 있습니다. 이는 네이버의 정책적 결정이며, 블로그 운영자가 수정할 수 없습니다. 병원이 네이버 블로그에 아무리 양질의 콘텐츠를 올려도, 그 내용은 ChatGPT나 Perplexity에서 절대 인용되지 않습니다. 이것이 "네이버 블로그가 ChatGPT에 보이지 않는 이유"입니다.

병원 사이트에서 흔한 실수 패턴

직접 운영하는 병원 웹사이트에서도 실수가 발생합니다. 홈페이지 개발사나 보안 담당자가 "모든 봇 차단"을 목적으로 robots.txt에 User-agent: * / Disallow: /를 설정하는 경우가 있습니다. 이 설정은 Googlebot을 포함한 모든 크롤러를 차단하며, AI 크롤러 역시 당연히 접근이 불가능해집니다. 또한 특정 디렉토리(예: /blog/, /faq/)만 차단한 경우, 정작 AI 인용에 중요한 페이지들이 크롤링에서 배제됩니다.

주요 AI 크롤러 User-Agent 목록

크롤러명 소속 AI 서비스 User-Agent 문자열 허용 방법
GPTBot ChatGPT (OpenAI) GPTBot robots.txt에서 Allow 명시
ChatGPT-User ChatGPT 브라우징 플러그인 ChatGPT-User robots.txt에서 Allow 명시
PerplexityBot Perplexity AI PerplexityBot robots.txt에서 Allow 명시
ClaudeBot Claude (Anthropic) ClaudeBot robots.txt에서 Allow 명시
Google-Extended Google AI / Bard / Gemini Google-Extended robots.txt에서 Allow 명시
Amazonbot Amazon Alexa AI Amazonbot robots.txt에서 Allow 명시
Applebot-Extended Apple AI (Siri, AI 학습) Applebot-Extended robots.txt에서 Allow 명시

올바른 robots.txt 설정

다음은 GEO 최적화를 위한 올바른 robots.txt 설정 예시와, 흔히 발생하는 잘못된 설정 예시입니다.

잘못된 설정 (AI 크롤러 전체 차단)

# 잘못된 예시 1: 모든 봇 완전 차단 User-agent: * Disallow: / # 잘못된 예시 2: AI 크롤러만 선별 차단 User-agent: GPTBot Disallow: / User-agent: PerplexityBot Disallow: / User-agent: ClaudeBot Disallow: /

올바른 설정 (AI 크롤러 허용 + 민감 영역만 차단)

# 올바른 robots.txt 설정 예시 # 작성일: 2025-04-18 # Googlebot: 전체 허용 User-agent: Googlebot Allow: / # 주요 AI 크롤러: 전체 허용 User-agent: GPTBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: ClaudeBot Allow: / User-agent: Google-Extended Allow: / User-agent: Amazonbot Allow: / # 모든 기타 봇: 공개 콘텐츠 허용, 관리자 영역만 차단 User-agent: * Disallow: /admin/ Disallow: /wp-admin/ Disallow: /patient-data/ Allow: / # 사이트맵 위치 명시 Sitemap: https://www.yourhospital.co.kr/sitemap.xml
중요 참고사항: robots.txt는 법적 구속력이 없습니다. AI 기업들은 대부분 robots.txt를 존중하지만, 일부 크롤러는 이를 무시할 수 있습니다. 반대로 AI 학습 데이터 수집에서 완전히 제외되길 원한다면, 각 AI 기업이 제공하는 옵트아웃(opt-out) 페이지를 통해 별도 신청해야 합니다.

robots.txt 수정 후에는 Google Search Console의 "URL 검사" 기능으로 크롤링 가능 여부를 확인하세요. AI 크롤러 전용 확인 도구는 아직 공식적으로 없지만, Googlebot 접근이 가능하면 대부분의 AI 크롤러도 접근 가능한 것으로 볼 수 있습니다. 또한 사이트맵(sitemap.xml)을 robots.txt에 명시하면 크롤러가 모든 주요 페이지를 효율적으로 발견할 수 있습니다.

핵심 요약 (Key Takeaways)

  • GPTBot, PerplexityBot, ClaudeBot, Google-Extended 등 주요 AI 크롤러는 전통적인 Googlebot과 별개의 User-Agent를 사용합니다.
  • 네이버 블로그는 주요 AI 크롤러를 플랫폼 차원에서 차단하므로, 아무리 좋은 콘텐츠도 AI에 인용될 수 없습니다.
  • 병원 공식 사이트에서 User-agent: * / Disallow: / 설정은 AI 크롤러를 포함한 모든 봇을 차단하는 치명적 실수입니다.
  • 올바른 robots.txt는 AI 크롤러를 명시적으로 허용하고, 관리자 영역·환자 데이터 디렉토리만 차단하는 구조여야 합니다.
  • robots.txt 수정 후 Google Search Console에서 크롤링 가능 여부를 반드시 확인하고, 사이트맵도 함께 명시하세요.
A
ACI 리서치팀
AI Citation Index(ACI) 리서치팀은 국내외 AI 검색 엔진의 의료 정보 인용 패턴을 분석하고, 병원 GEO 최적화 전략을 연구합니다. ChatGPT, Perplexity, Google AI Overview, Naver AI를 대상으로 매월 500개 이상의 의료 질의를 추적하며 데이터 기반 인사이트를 제공합니다.