TL;DR

  • 인간과 기계를 구분하는 데서 과제 수행 결과만 보는 방식보다 행동이 생성되는 과정을 분석하는 방식이 더 강한 판별력을 보이며, 수행 결과가 같아도 인간과 에이전트를 구분할 수 있음.
  • 인지 과학에 기반한 Process Turing Test를 제안하고 의사결정, 작업 기억, 계획 과제를 평가함.
  • 과정 수준의 특징은 수행 성과 지표만 사용할 때보다 판별 신호가 훨씬 강하며, 과정 기반 분류기의 AUC는 0.88임.
  • 인간의 선택으로 광범위하게 미세조정한 모델은 과정이 더 인간다워지고, 과제별 P-SFT는 이를 더 개선하지만 과제 간 전이에서는 이점이 대부분 사라짐.
  • 기계가 인간다운 인지 과정을 구현하는 데는 과정 명세가 핵심 병목임.

연구 배경과 Process Turing Test

  • 대형 언어 모델(LLM)과 자율 에이전트가 온라인 환경에 배치되면서 인간과 기계를 안정적으로 구분하는 일이 점점 중요해짐.
  • 기존 접근법은 기계가 인간과 구별되지 않는 응답을 생성할 수 있는지 평가하며, 이는 앨런 튜링이 제안한 기계의 출력에 초점을 둠.
  • 인지 과학은 행동이 생성되는 과정 자체를 살펴보는 대안을 제시함.
  • 인간과 기계의 과정을 안정적으로 구분할 수 있는지 평가하기 위해 과정 기반 프레임워크인 Process Turing Test를 도입하고, 의사결정·작업 기억·계획에 걸친 인지 과제 묶음에서 평가함.
  • 정신적 회전과 순서 예측 같은 과제는 전체 과제 수행 점수를 보완하는 과정 수준 측정치를 제공함. 여러 CAPTCHA 과제도 평가에 포함함.

과정 수준 특징의 판별력

  • 전체 과제 묶음에서 과정 수준 특징은 수행 지표만 사용할 때보다 훨씬 강한 판별 신호를 제공함.
  • 과제 수행 결과가 일치하는 경우에도 과정 특징으로 인간과 에이전트를 안정적으로 구분할 수 있으며, 과정 기반 분류기의 AUC는 0.88임.

레드팀 실험과 미세조정 결과

  • 통제된 레드팀 연구에서 기성 최첨단 에이전트인 Claude Sonnet 4.5, GPT-5, Gemini 2.5 Pro를 비교함.
  • 인간의 결정 1,070만 건으로 미세조정한 LLM인 Centaur, 과제별 미세조정 방법인 행동 수준 지도 미세조정(A-SFT)과 과정 수준 미세조정(P-SFT)도 비교 대상에 포함함. P-SFT는 과정 특징을 직접 최적화함.
  • 인간의 선택을 이용한 광범위한 미세조정은 기성 최첨단 에이전트와 비교해 과제 수행 과정을 더 인간답게 만듦.
  • 과제별 P-SFT는 인간다운 행동 모방을 추가로 개선하지만, 과제 간 전이에서는 이점이 대부분 사라짐.
  • 결과는 기계에서 인간다운 인지 과정을 구현할 때 과정 명세가 핵심 병목임을 보여줌.

논문 정보

  • 논문 제목: *Process Matters more than Output for Distinguishing Humans from Machines*.
  • 저자: Milena Rmus, Mathew D. Hardy, Thomas L. Griffiths, Mayank Agrawal.
  • arXiv 식별자: arXiv:2605.06524. v1 제출일은 2026년 5월 7일이며, 이 버전(v3)의 최종 수정일은 2026년 9월 28일임.
  • DOI: 10.48550/arXiv.2605.06524.