TL;DR

  • 27개 대규모 언어 모델(LLM)을 12개국 155개 주제에서 평가한 결과, 인식론적 다양성은 최근 3년간 크게 증가했지만 모든 모델이 검색 기준선보다 다양성이 낮음.
  • 연구는 170만 건의 응답에서 7,000만 개의 개별 주장을 분석함.
  • 다양성 감소에 대한 최근의 비관론과 달리 LLM의 인식론적 다양성은 실질적으로 증가했으나, 개선은 충분하지 않고 고르게 분포되지 않음.
  • 검색 증강 생성(RAG)은 다양성을 높일 수 있지만, 큰 모델이 작은 모델보다 오히려 덜 다양한 결과를 보임.
  • 국가별 주제에서 LLM의 매개변수 지식은 현지 언어 지식보다 영어 지식을 체계적으로 더 많이 반영함.

연구 배경과 범위

  • 대규모 언어 모델(LLM)이 주요 지식 출처로 널리 쓰이는 가운데, 출력에 포함된 현실 세계 주장들의 다양성인 인식론적 다양성은 이전까지 측정된 바 없음.
  • 인식론적 다양성이 낮으면 동질적인 LLM이 접근 가능한 정보의 범위를 시간이 흐르며 축소해 지식 붕괴 위험을 초래할 수 있음.
  • 기존의 지배적 관점은 LLM의 전반적 다양성이 낮다는 것이지만, 단일 시점만을 기준으로 삼고 비교 기준선이나 국가 간 차이를 고려하지 않음.
  • 연구진은 시간과 문화적 맥락을 아우르는 LLM 인식론적 다양성의 첫 체계적 연구로 27개 모델, 12개국 관련 155개 주제, 170만 건의 응답, 7,000만 개의 주장을 분석함.

주요 결과

  • LLM의 인식론적 다양성은 지난 3년간 상당히 증가했으며, 이는 최근의 다양성 비관론에 반하는 긍정적 결과임.
  • 진전에도 불구하고 평가 대상 모든 시스템의 다양성이 검색 기준선보다 낮음.
  • 다양성 격차는 모든 모델과 설정에서 동일하지 않으며, RAG는 다양성을 개선할 수 있음.
  • 큰 모델은 직관과 달리 작은 모델보다 다양성이 낮음.
  • 국가별 주제에서 LLM의 매개변수 지식은 현지 언어 지식보다 영어 지식에 체계적으로 치우침.
  • 종합하면 인식론적 다양성의 진전은 실질적이지만 충분하지 않으며, 그 분포도 고르지 않음.

논문 정보

  • 제목: *What and Whose Knowledge? Measuring Epistemic Diversity in Large Language Models*
  • 저자: Dustin Wright, Sarah Masud, Jared Moore, Srishti Yadav, Maria Antoniak, Peter Ebert Christensen, Chan Young Park, Isabelle Augenstein
  • arXiv: 2510.04226, 분야: 계산과 언어(cs.CL), 인공지능(cs.AI), 컴퓨터와 사회(cs.CY), 정보 검색(cs.IR), 기계 학습(cs.LG)
  • 최초 제출일은 2025년 10월 5일, 현재 버전(v7) 최종 수정일은 2026년 8월 31일임.
  • DOI: https://doi.org/10.48550/arXiv.2510.04226