Clicks Dynasty가 2026년 10월 8일 미국 주요 브랜드 56곳의 robots.txt를 조사한 결과, 38곳은 AI 크롤러를 별도로 언급하지 않았다. 뉴스·미디어 사이트는 8곳 중 6곳이 적어도 하나의 AI 크롤러를 완전히 차단하거나 조사 도구의 접근을 거부했지만, 다른 업종에서는 48곳 중 3곳에 그쳤다.

조사는 7개 업종에서 브랜드를 8곳씩 선정하고, 13개 AI 크롤러를 대상으로 규칙을 확인했다. 표본은 인지도에 따라 고른 것으로 무작위 표본이나 통계적으로 대표성을 갖춘 표본은 아니다.

  • 전체 56곳 중 38곳은 robots.txt에 AI 크롤러를 한 개도 명시하지 않았다. 일반 규칙은 AI 봇에도 적용되므로 실제로는 접근이 허용될 수 있지만, AI를 염두에 둔 별도 규칙을 작성한 것은 아니다.
  • 은행·결제 업체 8곳과 레스토랑 체인 8곳은 모두 AI 관련 규칙이 없었다. 항공사·호텔은 조사 대상 6곳 모두 AI 크롤러를 언급하지 않았다.
  • 뉴스·미디어 사이트는 75%(8곳 중 6곳)가 적어도 하나의 크롤러를 차단하거나 조사 도구의 접근을 거부했다. 다른 업종은 6%(48곳 중 3곳)였다.
  • 확인할 수 있었던 robots.txt 파일 52개 가운데 OpenAI의 OAI-SearchBot이나 Anthropic의 Claude-SearchBot을 이름으로 완전히 차단한 곳은 없었다.

검색용 봇과 학습용 봇을 나눠 설정한 사례

GPTBot, ClaudeBot, CCBot 같은 학습용 크롤러는 모델 학습에 쓸 페이지를 수집한다. OAI-SearchBot, Claude-SearchBot, PerplexityBot 같은 검색용 크롤러는 질문에 답하고 출처를 제시하기 위해 페이지를 가져온다. 조사에서 가장 많이 차단된 것은 학습용 봇이었다. GPTBot, ClaudeBot, Common Crawl의 CCBot은 각각 읽을 수 있었던 파일 52개 중 5개에서 완전히 차단됐다.

Forbes는 GPTBot, ClaudeBot을 비롯한 크롤러 9개를 완전히 차단하면서 OAI-SearchBot과 Claude-SearchBot은 명시적으로 허용했다. Airbnb는 GPTBot, ClaudeBot, Applebot-Extended를 완전히 차단했지만, ChatGPT의 검색·어시스턴트 봇과 PerplexityBot에는 일부 경로 제한만 적용했다. 두 사례는 학습용 수집은 막고 검색·인용은 허용하는 설정을 보여준다.

다른 브랜드도 각기 다른 규칙을 적용했다. GEICO는 AI 크롤러 12개를 명시하고 각각에 Allow: /를 설정했다. Costco는 ClaudeBot을 차단하지 않고 크롤링 속도만 제한했다. CVS는 의약품 정보 페이지에서만 크롤러 6개를 막았고, Expedia는 AI 검색·어시스턴트 봇에 경로 제한을 설정했다.

사이트 접근을 확인할 때 살펴볼 점

robots.txt만으로 크롤러 접근 여부를 모두 판단할 수는 없다. Amazon, CNN, NBC News는 해당 파일의 규칙 때문에 조사에 사용한 AI 보조 리더의 접근이 거부됐고, CNBC는 파일을 읽기 전에 서버에서 “403 forbidden” 오류를 반환했다. 방화벽이나 콘텐츠 전송 네트워크(CDN)도 별도로 봇을 차단할 수 있으므로, AI 검색 노출을 원한다면 파일의 규칙과 서버 측 차단을 함께 확인해야 한다.

Clicks Dynasty는 지역 사업자에게 AI 검색·어시스턴트 봇은 허용하고 학습용 봇은 별도로 결정하는 방식을 제안한다. 기존 Googlebot·Bingbot 규칙은 유지하면서 방화벽이나 CDN이 해당 봇을 막지 않는지도 확인하라고 안내했다. 제안한 설정은 다음과 같다.

`# Let AI search and assistants read and recommend you

User-agent: OAI-SearchBot

User-agent: ChatGPT-User

User-agent: Claude-SearchBot

User-agent: Claude-User

User-agent: PerplexityBot

Allow: /

Optional: opt out of AI model training

User-agent: GPTBot

User-agent: ClaudeBot

User-agent: Google-Extended

User-agent: Applebot-Extended

User-agent: CCBot

Disallow: /`

지역 사업자 웹사이트를 대상으로 한 Bakersfield AI 크롤러 조사에서는 14곳 중 1곳이 AI 크롤러를 차단한 것으로 나타났다. Clicks Dynasty는 이를 보안 플러그인이나 호스팅 기본 설정 때문에 우발적으로 발생한 경우가 많다고 설명한다. 조사 방법은 이번 대형 브랜드 조사와 다르다. California AI Visibility Index는 AI 도구별 추천 결과의 차이를 보여주며, 무료 SEO·AI 검사 도구는 크롤러 접근을 확인하는 데 쓸 수 있다.

조사 범위와 한계

자료는 2026년 10월 8일에 수집한 스냅샷이다. robots.txt는 크롤러에 보내는 공개 요청이지 강제 차단 장치가 아니며, 사이트 파일은 자주 바뀔 수 있다. 조사팀은 AI 보조 웹 리더로 각 파일을 가져와 13개 크롤러 규칙을 기록했다. 파일이 리더의 접근을 거부하면 ‘거부’로 기록했다. 원래 포함하려던 매체 세 곳은 도구로 자료를 가져올 수 없어 다른 전국 단위 매체로 대체했다. 방화벽은 서버가 접근을 거부한 경우 외에는 시험하지 않았다.

전체 자료는 CSV 파일로 내려받을 수 있으며 CC BY 4.0에 따라 재사용할 수 있다. 오류 제보는 Clicks Dynasty에 문의하면 된다. 원문에는 전체 크기 조사 이미지도 제공된다. Clicks Dynasty는 브랜드나 언급된 AI 회사와 제휴하지 않았으며, 이번 조사는 특정 날짜의 공개 robots.txt 내용만 다룬다고 밝혔다. 보고서 인용 정보는 Clicks Dynasty, “Big Brand AI Crawler Study,” October 2026이며 원문 주소는 clicksdynasty.com/big-brand-ai-crawler-study.html이다.

AI 검색 노출을 위한 AI SEO 서비스와 문의 페이지도 안내하고 있다. 조사 대상 브랜드 이름은 각 소유자의 상표다.

자료: 홈, 블로그, Ravinder Cheema 소개.