TL;DR
- 오해를 부르는 AI 생성 요약은 영상 속 사건에 관한 인간의 기억을 왜곡할 수 있으며, 특히 경찰·의료 등 고위험 분야에서 신중한 활용이 필요함.
- ChatGPT와 Gemini가 생성한 요약은 핵심 세부 정보의 평균 51.6%를 빠뜨렸으며, 요약 중 95%가 자동차와 보행자의 충돌이라는 가장 중요한 정보를 누락함.
- 정확한 요약을 읽은 참가자의 83.6%가 교통 표지판을 정확히 기억했지만, 오해를 부르는 요약을 읽은 참가자는 44.8%만 정답을 고름.
- 요약이 AI가 아니라 인간이 작성했다고 안내받은 경우에도 오해를 부르는 요약의 기억 왜곡 효과가 나타났으며, AI에 대한 신뢰나 친숙도에 좌우되지 않음.
- 조지타운대학교와 워싱턴대학교 연구진은 AI 요약의 오류가 인간의 기억을 바로잡기보다 왜곡할 수 있다고 지적하며, 실제 현장 영상과 조직용 AI 모델을 대상으로 한 추가 검토 필요성을 제기함.
주요 결과
- 뉴스 기사 미리보기와 직장 회의 기록부터 경찰 바디캠 영상 같은 고위험 상황까지 AI 생성 요약의 활용이 늘고 있지만, AI가 오해를 부르거나 부정확한 정보를 생성할 수 있다는 연구 결과도 축적되고 있음.
- 조지타운대학교와 워싱턴대학교 연구진의 새 연구에 따르면, 영상 요약을 요청받은 AI 시스템이 잘못된 정보를 출력할 경우 사람들의 기억과 진실에 대한 인식을 왜곡할 수 있음.
- 「AI 기반 인간 기억 조작: 오해를 부르는 AI 생성 요약이 인간의 기억을 왜곡함」 연구는 최근 발표됐으며, 2026년 10월 열리는 동료 심사 학술대회인 제9회 AI·윤리·사회 콘퍼런스(AIES)에서 발표될 예정임.
- 조지타운대학교 맥코트 공공정책대학원 대규모 데이터 연구소(MDI)의 조교수 Mattea Sim이 연구를 이끌었으며, 공동 연구자는 조지타운대학교 컴퓨터과학과와 디지털 윤리 센터 교수이자 컴퓨터과학·윤리·사회 분야 McDevitt 석좌인 Yoshi Kohno, 워싱턴대학교 박사과정생 Yael Eiger임.
“이번 연구는 심리학과 컴퓨터과학을 바탕으로 AI와 인간 사이의 영향과 관계를 살펴보는 조지타운대학교의 확대 중인 연구 노력의 일부임.” — Yoshi Kohno
주요 시사점
- AI 요약은 중요한 세부 정보를 빠뜨릴 수 있다는 기존 연구 결과를 뒷받침함. 이번 연구에서 가장 흔한 오류 유형은 자동차와 보행자 사고를 담은 애니메이션 영상의 주요 사건을 언급하지 않는 누락임.
- 모든 프롬프트와 모델을 통틀어 요약은 중심 세부 정보의 평균 51.6%를 누락함. 요약 중 단 하나를 제외한 95%가 영상에서 가장 중요한 세부 정보인 자동차와 보행자의 충돌을 빠뜨림.
- 오해를 부르는 AI 요약은 사건에 관한 사람들의 기억을 왜곡할 수 있음. 영상 속 자동차가 ‘정지’ 표지판을 만났는지 ‘양보’ 표지판을 만났는지 질문했을 때, 정확한 정보를 담은 요약을 읽은 참가자는 83.6%가 정답을 골랐지만 오해를 부르는 요약을 읽은 참가자는 44.8%만 정답을 고름.
- 사람들이 요약을 AI 또는 인간이 작성했다고 믿는지와 관계없이 AI 요약의 허위 정보에 취약할 수 있음. 이번 연구에서 오해를 부르는 AI 요약이 인간의 기억에 미친 영향은 AI에 대한 신뢰나 친숙도에 좌우되지 않음.
“AI는 허위 정보를 전달하는 새로운 방식이며, 해당 정보를 읽는 사람에게 잘못된 기억을 만들어낼 가능성이 있음. 특히 고위험 상황에서 AI를 정보를 요약하는 데 사용할지, 사용한다면 어떻게 사용할지 깊고 비판적으로 검토해야 함.” — Mattea Sim
AI 요약과 인간의 기억
- 연구진은 AI 요약이 인간의 기억에 미치는 영향을 살펴보기 위해 두 가지 접근법을 사용함.
- 첫 번째로 OpenAI의 ChatGPT와 Google의 Gemini가 생성한 요약을 분석해 오류의 빈도와 유형을 측정함. AI 요약에서 빈번한 오류와 중요한 세부 정보의 누락, 정보의 오해, 부정확한 세부 정보의 환각이 나타남.
“AI 개발이 이뤄진 현 단계에서도 요약이 매우 부실하다는 점이 인상적이었음. 수감·교정 체계에서 기술을 연구하는 입장에서, 경찰서가 엄격한 검증이나 AI 생성 요약의 오류가 초래할 수 있는 문제에 대한 인식 없이 영상 요약 기술을 사용할 가능성이 우려됨.” — Yael Eiger
- 실험에서 연구진은 참가자에게 최근 복제 연구에서 고전적인 인간 기억 연구 자료를 현대화해 만든 애니메이션 영상 두 편 중 하나를 시청하게 함.
“실제 경찰 바디캠 영상은 사용하지 않았음.” — Yoshi Kohno
- 영상에는 빨간 자동차가 교차로의 정지 또는 양보 표지판에 접근하는 장면이 담겼으며, 참가자는 두 표지판 중 하나가 등장하는 영상을 무작위로 배정받음.
- 자동차는 교차로에서 우회전하다가 도로에 들어서는 보행자와 충돌함. 보행자는 넘어졌다가 일어서고, 운전자는 차에서 내려 두 사람이 만남.
- 실험의 두 번째 단계는 24~48시간 후 진행됨. 참가자에게는 정확한 AI 생성 요약 또는 연구진이 부정확한 세부 정보를 삽입한 요약이 무작위로 배정됨.
- 요약을 읽기 전에 참가자는 해당 요약이 AI 또는 인간 전사자가 작성한 것이라고 안내받음. 하지만 모든 요약 텍스트는 ChatGPT가 생성했으며, 실험 조건을 균일하게 맞추기 위해 일부 경우 ChatGPT 답변의 서로 다른 부분을 조합함.
- 실험의 두 단계를 모두 마친 참가자는 총 331명임.
- 연구에 따르면 오해를 부르는 AI 요약을 읽은 참가자는 정확한 AI 요약을 읽은 참가자보다 원래 사건을 정확히 기억할 가능성이 유의미하게 낮음. 요약이 AI가 생성한 것이라고 안내받은 경우에도 기억 왜곡이 나타남.
“이 결과는 중요한 상황에서 AI를 어떻게 사용해야 하는지에 시사점을 줌. ‘인간 참여형’ 방식에서는 사람이 AI의 실수를 바로잡을 것으로 흔히 기대하지만, 이번 연구는 인간의 기억이 오히려 그 실수로 왜곡될 수 있음을 시사함. AI는 적대적 의도가 전혀 없어도 허위 정보를 생성해 인간의 기억에 실질적인 영향을 줄 가능성이 있음.” — 연구진의 논문
기술 발전과 상충 관계
- 개인과 사회의 AI 의존도가 커지는 가운데, Kohno는 이번 연구 결과가 AI 출력이 인간의 세계 인식에 직접 영향을 미칠 수 있다는 점을 더 주의 깊게 인식하게 하길 바람.
- 이러한 영향은 경찰 활동이나 의료 분야처럼 결과의 중요성이 큰 상황에서 특히 클 수 있음.
“감시나 경찰 조직의 효율성 향상에 활용되는 등 경찰이 점점 더 도입하는 기술에 큰 관심이 있음. 이 기술은 유익한 것으로 홍보되고 설명되지만, 그에 따른 상충 관계는 무엇인지 물어야 함.” — Yael Eiger
- Eiger는 이러한 기술에 대한 감사를 더 많이 진행하길 바람. 이번 연구는 최신 소비자용 대형 언어 모델(LLM)을 사용했지만, 연구진은 조직용으로 설계된 기업용 AI 모델에는 접근하지 못함.
“AI를 모든 분야에 도입하려는 경쟁이 진행되는 가운데, 기술이 작동하는 방식이나 실제 사용되는 정확한 모델에 관해 알 수 있는 정보가 많지 않다는 점은 대중의 의견 제시와 투명성 측면에서 흥미로운 문제임.” — Yael Eiger
- 후속 연구에서는 애니메이션 영상 대신 실제 사례를 살펴볼 계획임.
“경찰 바디캠 영상에서 AI 요약은 어떻게 만들어지고, AI가 생성한 경찰 보고서는 어떤 모습인지 궁금함. 이러한 요약이 경찰과 민간인의 상호작용에 관한 사람들의 기억을 조작하고, 결과적으로 사건에 대한 인식에도 영향을 미치는지 살펴보는 연구가 매우 흥미로울 것임.” — Mattea Sim
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요