TL;DR

  • 위키백과 문서가 사람과 인공지능(AI) 중 누구에 의해 작성됐는지 판별하는 퀴즈로 10개 문서와 보너스 문서 1개를 제시하며, 결과는 완벽한 판별법이 아님을 강조함.
  • 대상 문서는 Kamru Village, Rainforests of Malaysia, C. B. Fisk, Jewish peoplehood 등 다양한 주제의 위키백과 문서임.
  • 참가자 점수는 2/10부터 10/10까지 폭넓게 나타나며, 사람 문서를 AI가 썼다고 잘못 판단한 사례가 자주 언급됨.
  • 참가자들은 문체뿐 아니라 참고 문헌, 출처의 신뢰성, 서식, 문장 구성 등을 판별 단서로 삼았으며, 부실하거나 편향된 글이 반드시 AI가 쓴 글을 뜻하지는 않는다는 지적도 나옴.
  • 자동 판별기는 GPTZero와 Winston AI가 10/10, Pangram이 9/10, ZeroGPT가 7/10을 기록했고, 일반 대형 언어 모델(LLM)은 GPT-5.4가 8/10, Opus 4.6이 10/10을 기록함.

위키백과 AI 판별 퀴즈

  • 각 위키백과 문서가 사람 또는 AI에 의해 작성됐는지 판별하는 퀴즈임. 정답과 AI 작성의 징후는 각 문서의 하단에 제시됨.
  • 일부 문서는 접근 날짜처럼 정답을 쉽게 드러내는 단서를 제거하도록 수정됐으며, 페이지 이력을 보면 정답이 밝혀질 수 있음.
  • 이 시험은 완벽하지 않으며, 실제 상황에서는 페이지 이력과 작성자의 다른 편집도 고려해야 함.

문서 목록

  • Kamru Village
  • Rainforests of Malaysia
  • C. B. Fisk
  • Jewish peoplehood
  • Prevagen
  • Alessandro Bausani
  • Senchal Lake
  • Rapa fruit dove
  • Pusionella ghanaensis
  • Telna Inc.

보너스 문서

  • Scalping (trading): 이례적이고 엉뚱한 사례로 소개됨.

참가자들의 점수와 반응

  • 참가자 점수는 2/10에서 10/10까지 다양하며, 보너스 문항을 포함해 11개 문항을 푼 사람들의 결과도 기록됨.
  • 여러 참가자가 Jewish peoplehood와 Rapa fruit dove를 AI가 작성했다고 잘못 판단했다고 밝힘. 굵은 글씨, 글머리표, 문체, 짧은 문단, 화려한 표현 등이 판단을 흐린 단서로 언급됨.
  • 사람 문서를 AI 문서로 잘못 분류하는 오탐이 반복적으로 보고됨. 일부 참가자는 반대로 AI 문서를 사람 문서로 판단했다고 설명함.
  • 참가자들이 언급한 판별 단서는 일반화, 환각, 인용되지 않은 주장, 참고 문헌의 적절성, 위키텍스트 서식, 구두점, 하이픈 사용, 문법 오류와 문단 구성 등임.
  • 글이 나쁘거나 편향됐다는 사실만으로 AI가 썼다고 볼 수 없으며, 사람도 AI처럼 보이는 문장을 쓸 수 있다는 의견이 제시됨.
  • 일부 참가자는 표본이 더 커야 판별 능력을 더 분명하게 평가할 수 있다고 언급함. 빠르게 훑어보거나 AI 글의 징후를 미리 읽지 않은 경우 오판이 많았다는 반응도 있음.

자동 판별기

  • GPTZero: 10/10
  • Pangram: 9/10 — 거짓 음성 1건
  • ZeroGPT: 7/10 — 거짓 양성 2건, ‘혼합’으로 잘못 분류한 거짓 양성 1건
  • Winston AI: 10/10

일반 대형 언어 모델

  • GPT-5.4: 8/10 — ClaudineChionh가 2026년 4월 12일에 프롬프트를 입력함.
  • Opus 4.6: 10/10 — ClaudineChionh가 2026년 4월 12일에 프롬프트를 입력함.

외부 링크