robots.txt와 AI 크롤러: 병원이 몰랐던 차단 문제
AI 크롤러의 정체
ChatGPT, Perplexity, Claude, Google AI Overview 등의 AI 검색 시스템은 웹의 콘텐츠를 직접 크롤링해 학습 데이터 또는 실시간 검색 결과에 반영합니다. 이 크롤러들은 전통적인 검색 엔진 봇(Googlebot, Bingbot)과는 별개의 User-Agent를 사용하며, 기존 SEO 설정이 이들을 차단하는 경우가 빈번합니다.
2023년 이후 주요 AI 기업들이 공식 발표한 크롤러 현황을 살펴보면, OpenAI는 GPTBot과 ChatGPT 플러그인 검색용 ChatGPT-User를 운영합니다. Perplexity AI는 PerplexityBot을 운영하며, Anthropic(Claude 제조사)은 ClaudeBot과 Claude-Web을 사용합니다. Google은 AI Overview 데이터 수집을 위해 Google-Extended를 별도로 운영하며, Meta AI는 FacebookBot과 함께 Meta-ExternalAgent를 사용합니다.
이 크롤러들이 중요한 이유는 단순합니다. 크롤러가 페이지에 접근하지 못하면, AI는 해당 콘텐츠를 절대 인용할 수 없습니다. 아무리 훌륭한 GEO 최적화 작업을 해도, robots.txt에서 AI 크롤러를 차단하고 있다면 모든 노력이 물거품이 됩니다.
robots.txt 차단이 AI 인용을 막는 방법
robots.txt는 웹 크롤러에게 어느 페이지를 크롤링해도 되는지, 하지 말아야 하는지를 알려주는 텍스트 파일입니다. 병원 사이트에서 AI 크롤러 차단이 발생하는 가장 흔한 패턴 두 가지가 있습니다.
네이버 블로그의 전면 차단 사례
네이버 블로그(blog.naver.com)의 robots.txt는 PerplexityBot, GPTBot, ClaudeBot 등 주요 AI 크롤러를 기본적으로 차단하는 설정을 가지고 있습니다. 이는 네이버의 정책적 결정이며, 블로그 운영자가 수정할 수 없습니다. 병원이 네이버 블로그에 아무리 양질의 콘텐츠를 올려도, 그 내용은 ChatGPT나 Perplexity에서 절대 인용되지 않습니다. 이것이 "네이버 블로그가 ChatGPT에 보이지 않는 이유"입니다.
병원 사이트에서 흔한 실수 패턴
직접 운영하는 병원 웹사이트에서도 실수가 발생합니다. 홈페이지 개발사나 보안 담당자가 "모든 봇 차단"을 목적으로 robots.txt에 User-agent: * / Disallow: /를 설정하는 경우가 있습니다. 이 설정은 Googlebot을 포함한 모든 크롤러를 차단하며, AI 크롤러 역시 당연히 접근이 불가능해집니다. 또한 특정 디렉토리(예: /blog/, /faq/)만 차단한 경우, 정작 AI 인용에 중요한 페이지들이 크롤링에서 배제됩니다.
주요 AI 크롤러 User-Agent 목록
| 크롤러명 | 소속 AI 서비스 | User-Agent 문자열 | 허용 방법 |
|---|---|---|---|
| GPTBot | ChatGPT (OpenAI) | GPTBot | robots.txt에서 Allow 명시 |
| ChatGPT-User | ChatGPT 브라우징 플러그인 | ChatGPT-User | robots.txt에서 Allow 명시 |
| PerplexityBot | Perplexity AI | PerplexityBot | robots.txt에서 Allow 명시 |
| ClaudeBot | Claude (Anthropic) | ClaudeBot | robots.txt에서 Allow 명시 |
| Google-Extended | Google AI / Bard / Gemini | Google-Extended | robots.txt에서 Allow 명시 |
| Amazonbot | Amazon Alexa AI | Amazonbot | robots.txt에서 Allow 명시 |
| Applebot-Extended | Apple AI (Siri, AI 학습) | Applebot-Extended | robots.txt에서 Allow 명시 |
올바른 robots.txt 설정
다음은 GEO 최적화를 위한 올바른 robots.txt 설정 예시와, 흔히 발생하는 잘못된 설정 예시입니다.
잘못된 설정 (AI 크롤러 전체 차단)
올바른 설정 (AI 크롤러 허용 + 민감 영역만 차단)
robots.txt 수정 후에는 Google Search Console의 "URL 검사" 기능으로 크롤링 가능 여부를 확인하세요. AI 크롤러 전용 확인 도구는 아직 공식적으로 없지만, Googlebot 접근이 가능하면 대부분의 AI 크롤러도 접근 가능한 것으로 볼 수 있습니다. 또한 사이트맵(sitemap.xml)을 robots.txt에 명시하면 크롤러가 모든 주요 페이지를 효율적으로 발견할 수 있습니다.
핵심 요약 (Key Takeaways)
- GPTBot, PerplexityBot, ClaudeBot, Google-Extended 등 주요 AI 크롤러는 전통적인 Googlebot과 별개의 User-Agent를 사용합니다.
- 네이버 블로그는 주요 AI 크롤러를 플랫폼 차원에서 차단하므로, 아무리 좋은 콘텐츠도 AI에 인용될 수 없습니다.
- 병원 공식 사이트에서 User-agent: * / Disallow: / 설정은 AI 크롤러를 포함한 모든 봇을 차단하는 치명적 실수입니다.
- 올바른 robots.txt는 AI 크롤러를 명시적으로 허용하고, 관리자 영역·환자 데이터 디렉토리만 차단하는 구조여야 합니다.
- robots.txt 수정 후 Google Search Console에서 크롤링 가능 여부를 반드시 확인하고, 사이트맵도 함께 명시하세요.