TL;DR

  • 언어 모델의 우울증 평가에서 모델 선택은 증상 점수 분산의 30.0%를 설명해 참가자 간 안정적 차이(10.5%)보다 큰 영향임.
  • 연구진은 11개 오픈 모델과 프롬프트·점수화 선택을 조합한 880개 평가자를 사전 등록하고, 189건의 인터뷰를 8개 항목 환자 건강 설문지(PHQ-8)와 비교함.
  • 판별 성능이 AUC 0.70 이상인 평가자 두 명도 평균적으로 참가자의 40%에 대한 선별 판단이 달랐음.
  • 새 인터뷰 86건을 대상으로 한 잠금 분석에서 사전 등록 결과의 주요 내용이 재현됐으며, 참가자 40명을 이용한 탐색적 재보정은 정확도를 약 60%에서 75%로 높이고 불일치를 절반으로 줄임.
  • 재보정 후에도 참가자 5명 중 1명에 대한 판단이 달라, 평가자 의존성은 상당 부분 줄었지만 개인별 판단의 일치는 확보되지 않음.

연구 배경과 설계

  • 우울증에는 진단용 혈액 검사가 없으며, 언어 모델은 지치지 않고 일관된 평가를 제공할 가능성이 있지만 개인별 평가에서 정확한 평가자들끼리도 의견이 다를 수 있는지가 연구 질문임.
  • 11개 오픈 모델에 프롬프트와 점수화 선택을 조합해 총 880개 언어 모델 평가자를 사전 등록함.
  • 평가자들을 189건의 인터뷰에 적용하고, 결과를 8개 항목 환자 건강 설문지(PHQ-8)와 대조함.

주요 결과

  • 모델 선택이 합산 증상 점수 분산의 30.0%를 설명했으며, 참가자 간 안정적 차이가 설명한 비율은 10.5%임.
  • 수신자 조작 특성 곡선 아래 면적(AUC)이 0.70 이상인 평가자 두 명을 무작위로 뽑아 비교했을 때, 평균적으로 참가자의 40%에 대한 선별 판단이 일치하지 않음.
  • 평균적인 과대평가 정도가 몇 명을 선별 대상으로 표시하는지를 좌우했지만, 평가 용량이 같은 평가자들도 참가자 5명 중 약 1명을 서로 다르게 판단함.

재현 및 재보정

  • 86건의 신규 인터뷰를 대상으로 한 잠금 분석에서 사전 등록된 주요 결과가 재현됨.
  • 40명의 라벨이 지정된 참가자를 활용한 탐색적 재보정으로 정확도가 약 60%에서 75%로 높아지고 평가자 간 불일치가 절반으로 줄어듦.
  • 재보정 뒤에도 참가자 5명 중 1명은 평가자에 따라 판단이 달랐으며, 재보정은 평가자 의존성을 상당 부분 개선했지만 개인별 판단의 합의를 보장하지 않음.

논문 정보

  • 저자: Baihan Lin
  • 분야: 계산 언어학(Computation and Language), 인공지능(Artificial Intelligence), 뉴런과 인지(Neurons and Cognition)
  • 제출일: 2026년 10월 6일
  • 논문 식별자: arXiv:2610.08501
  • DOI: https://doi.org/10.48550/arXiv.2610.08501