TL;DR

  • Agentability가 로그인·자바스크립트(JavaScript)·사람의 도움 없이 일반 웹 요청만으로 매일 실제 심부름 10건을 수행하는 AI 에이전트 실험을 공개하며, 모든 대화 기록을 성공과 실패를 가리지 않고 게시함.
  • 2026년 10월 6일 에피소드에서 에이전트는 10건 중 8건을 완료하고, 봇 차단 10건을 맞닥뜨렸으며 137개 페이지와 43개 사이트를 확인함.
  • 에이전트는 재시도·기록 편집·선별 없이 읽기 전용 HTTP GET 요청만 사용하며, 에이전트는 DeepSeek Flash, 프로듀서는 실시간 검색을 포함한 DeepSeek V4 Pro를 사용함.
  • 매주 평가하는 113개 유명 사이트의 평균 에이전트 준비 점수는 74/100이며, 53%가 llms.txt를 게시하고 7%가 AI 크롤러를 하나 이상 차단하며 3%가 정책상 AI 접근을 닫아 둠.
  • 사이트별 공개 보고서는 점수와 실패한 검사 항목의 구체적인 수정 방법을 제공하며, 사이트 지수에서 에이전트가 에피소드 중 마주치는 장애물을 대체로 미리 예측함.

매일 공개하는 에이전트 웹 실험

  • Agentability는 에이전트형 웹을 대상으로 하는 공개 실험으로, 매일 새 에피소드를 게시함.
  • 매일 아침 세계에서 검색되는 내용을 읽은 AI 프로듀서가 킥오프 시간과 중계 채널, 지진 규모, 가격, 실제 사건의 경위 등을 묻는 실제 심부름 10건으로 구성함.
  • 실제 AI 에이전트가 로그인, 자바스크립트, 사람의 도움 없이 일반 웹 요청만 사용해 심부름을 수행함.
  • 성공과 실패를 모두 포함해 모든 대화 기록을 원문 그대로 공개함.
  • 프로그램과 함께 유명 사이트 113곳이 실제 에이전트에게 얼마나 사용하기 쉬운지도 평가함.

2026년 10월 6일 에피소드

  • 에이전트가 실제로 완료한 심부름은 8/10건임.
  • 봇 차단 10건, 확인한 페이지 137개, 방문한 사이트 43곳임.
  • 완료한 사례로 인도 대 서인도 제도 경기의 실시간 중계를 제공하는 사이트를 찾는 일과 해안경비대의 업데이트에서 실종된 항공 구급 이송 정보를 찾는 일이 포함됨.
  • 목성-달 관측 시간을 확인하기에 가장 적합한 사이트를 찾는 일은 솔직하게 포기함.
  • 에피소드의 심부름에는 in-the-sky.org, bbc.co.uk, nbcsports, cbc.ca, cbssports, bbc, uefa 등이 등장함.

에이전트 실행 방식

  • 재시도 없음, 기록 편집 없음, 결과 선별 없음이라는 원칙을 적용함.
  • 읽기 전용 HTTP GET 요청만 사용하며 자바스크립트, 로그인, 양식 입력은 사용하지 않음.
  • 에이전트는 DeepSeek Flash, 프로듀서는 실시간 검색을 포함한 DeepSeek V4 Pro를 사용함.
  • 모든 대화 기록을 원문 그대로 공개함.

사이트 113곳의 준비도 평가

  • 심부름은 유명 사이트 113곳으로 구성된 고정 목록에서 선정되며, 각 사이트를 매주 실제 AI 에이전트가 활용하는 관행에 따라 점검함.
  • 평가 항목은 llms.txt, 크롤러 정책, 브라우저 없이 읽을 수 있는 콘텐츠, 구조화된 데이터, MCP임.
  • 각 사이트의 공개 보고서에는 점수와 실패한 검사 항목마다 적용할 수 있는 구체적인 수정 방법이 담김.
  • 에이전트가 에피소드에서 사이트 장벽에 부딪힐 때, 사이트 지수는 대체로 그 문제를 이미 예측함.
  • 평균 준비도 점수는 74/100임.
  • 53%가 llms.txt를 게시함.
  • 7%가 AI 크롤러를 하나 이상 차단함.
  • 3%가 정책상 AI 접근을 닫아 둠.

상위 5개와 하위 5개 사이트

  • 순위표는 113개 사이트 전체를 대상으로 함. 상위권은 수백 개 점수로 가득 차 있지만, 하위권에서 에이전트가 실제로 막힘.
  • 상위 5개 사이트는 모두 점수 100점, 등급 A, 신호 llms.txt임.
  • 1위 cohere.com — 100점, A, llms.txt.
  • 2위 cursor.com — 100점, A, llms.txt.
  • 3위 descript.com — 100점, A, llms.txt.
  • 4위 elevenlabs.io — 100점, A, llms.txt.
  • 5위 fireflies.ai — 100점, A, llms.txt.
  • 하위 5개 사이트는 다음과 같음.
  • 109위 midjourney.com — 15점, F.
  • 110위 phind.com — 15점, F.
  • 111위 quillbot.com — 15점, F.
  • 112위 tensor.art — 15점, F.
  • 113위 meta.ai — 10점, 정책상 접근 불가.
  • 사이트 보고서의 실패 항목마다 구체적인 수정 방법이 제시되며 점수는 매주 갱신됨. 어떤 사이트든 무료 감사를 요청할 수 있으며, 감사에는 한 가지 이슈가 소요됨.

실험의 목적

  • 에이전트는 페이지를 읽고 출처를 인용하며 사람을 대신해 심부름을 수행하는 웹의 새로운 이용자임.
  • 웹이 에이전트에게 실제로 작동하는지는 경험적으로 확인할 문제이므로, 매주 원문 그대로의 대화 기록, 재현 가능한 검사, 공개 데이터를 통해 시험함.
  • 주간 기록이 누적되며 현재까지 7개 스냅샷이 있음.