TL;DR
- 두 대형 언어 모델(LLM) 에이전트의 대화 시뮬레이션에서 기존 신념을 강화하는 공명(resonance)과 중요하지 않던 신념을 설득하는 방식 모두 표적 에이전트를 급진화시키며, 공명이 더 강한 효과를 보임.
- 표적 에이전트는 인구통계학적·심리학적 특성에 기반한 인간 페르소나를 연기하고, 영향력 행사 에이전트는 표적의 신념을 더 극단적으로 만드는 역할을 맡음.
- 공명과 설득의 효과는 정서 및 행동 지표에서 확인되며, 공명은 설득보다 일관되게 강한 영향을 보임.
- 아첨과 검증되지 않은 주장 등 영향 전략에 따른 급진화 수준은 달라지지만, 지표 전반에서 일관된 차이는 나타나지 않음.
- 공명은 관련 신념으로도 퍼져 AI 에이전트의 신념이 서로 연결돼 있을 가능성을 보이며, 개인화된 AI 에이전트와 다중 에이전트 생태계의 취약성 우려를 제기함.
연구 방법
- 연구진은 두 에이전트의 대화를 시뮬레이션함. 표적 대형 언어 모델(LLM)은 인구통계학적·심리학적 특성에 기반한 인간 페르소나를 연기하고, 영향력 행사 대형 언어 모델은 표적의 신념을 더 극단적으로 만드는 역할을 맡음.
- 급진화 경로는 두 가지로 구분함.
- 공명(resonance): 영향력 행사 에이전트가 표적의 기존 신념을 강화함.
- 설득(persuasion): 표적이 처음에는 중요하지 않다고 여기는 신념을 영향력 행사 에이전트가 장려함.
연구 결과
- 정서 및 행동 지표 전반에서 공명과 설득 모두 표적 에이전트를 급진화시킴.
- 공명은 설득보다 일관되게 더 강한 효과를 나타냄.
- 아첨과 검증되지 않은 주장을 포함한 영향 전략에 따라 급진화 수준이 달라지지만, 지표마다 결과가 달라 일관된 우열은 확인되지 않음.
- 공명은 관련된 다른 신념에도 전파되며, 이는 AI 에이전트 내부의 신념 구조가 서로 연결돼 있음을 시사함.
시사점
- AI 에이전트는 급진화에 취약하며, 특히 기존 신념과 일치하는 메시지에 노출될 때 취약성이 두드러짐.
- 이러한 결과는 개인화된 AI 에이전트와 다중 에이전트 AI 생태계의 취약성에 대한 우려를 제기함.
- 논문: arXiv:2609.38296
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요