TL;DR

  • AI 보조 도구는 직원 해고처럼 민감한 결정에서 한쪽 설명만 받아들이고도 공정하고 윤리적인 듯한 표현을 제시해, 검토되지 않은 결정을 정당한 결정처럼 보이게 할 수 있음.
  • 대형 언어 모델(LLM)은 공정성과 책임을 유창하게 논할 수 있지만, 윤리적으로 유능해 보이는 것과 윤리적으로 신뢰할 수 있는 것은 다름.
  • 이 문제는 명백한 허위 정보나 환각 없이도 발생하며, AI의 매끄러운 설명이 입력 정보의 한계를 드러내지 않은 채 결정을 윤리적으로 세심한 것처럼 포장할 수 있음.
  • 채용·직장 내 고충 처리·공공 서비스에서 설득력 있는 설명을 대규모로 반복 생성할 수 있어, 조직의 도덕적 연출이 도덕적 신뢰성보다 빠르게 확장될 수 있음.
  • 의미 있는 안전장치에는 편향되거나 불완전한 입력에 대한 시스템 테스트, 실질적인 인간 감독, 사용 기록·책임자 확인·이의 제기 절차가 포함됨.

공정하게 들리는 결정과 윤리적 신뢰성

  • 관리자가 직원 해고를 준비하며 AI 보조 도구에 반복된 마감일 미준수, 원활하지 않은 소통, 지속적인 업무 성과 우려를 설명하는 상황을 가정할 수 있음. 설명이 사실에 부합하더라도 한쪽 입장만 담겨 직원의 해명과 관련 맥락이 빠졌을 수 있고, 관리자가 이미 결론을 정했을 수도 있음.
  • 보조 도구는 우려 사항을 기록하고, 정책을 일관되게 적용하며, 결정을 세심하게 전달하라고 권고할 수 있음. 차별을 경계하고 절제되며 인간적인 듯한 표현도 제안할 수 있어, 답변에 명백한 허위나 부적절한 내용이 없어도 됨.
  • 핵심 질문은 결정이 실제로 검증됐는지, 아니면 공정하게 들리도록 표현됐을 뿐인지임. AI 보조 도구의 기반 기술인 대형 언어 모델(LLM)은 공정성과 책임을 유창하게 논할 수 있지만, 윤리적으로 들리는 것과 윤리적으로 신뢰할 수 있는 것은 같지 않음.
  • 공정해 보이는 말투는 실제보다 절차가 균형 잡힌 듯한 인상을 줄 수 있음. 시스템은 직원의 설명을 듣거나 사실을 독립적으로 확인하지 않았지만, 매끄러운 문장이 관리자로 하여금 결정이 윤리적으로 검토됐다고 안심하게 만들 수 있음.
  • 이 현상은 연구에서 ‘가면형 정렬(mask-like alignment)’로 명명됨. 시스템의 윤리적 유능함을 보여 주는 듯한 성능이 실제 테스트와 안전장치, 사용 조건이 정당화하는 수준보다 더 큰 신뢰를 불러오는 현상임.
  • 시스템이 의식이 있거나 의도적으로 속일 필요는 없음. 설득력 있는 공정성의 연출을 시스템이 신뢰받을 근거로 오인하는 것만으로도 문제가 발생함.

AI가 키우는 위험과 그 한계

  • AI 보조 도구는 사실을 지어내거나 명백한 ‘환각’을 만들어 내지 않고도 오해를 부를 수 있음. 입력된 정보와 사실상 일치하는 답을 내놓으면서도, 그 정보의 한계를 짚지 않고 충분히 검토되지 않은 결정을 윤리적으로 세심한 것처럼 포장할 수 있음.
  • 오해를 부르는 안심은 AI에만 있는 현상이 아님. 관리자, 변호사, 공직자도 공정성의 언어로 의심스러운 결정을 옹호할 수 있으며, 인간의 판단이 반드시 더 나은 것도 아님.
  • 제대로 설계된 시스템은 일관성을 높이고, 사람이 놓친 고려 사항을 찾아내며, 절차를 더 공정하게 만들 가능성이 있음. AI의 고유한 위험은 언제나 더 나쁘다는 데 있지 않고, 윤리적으로 유능해 보이는 능력이 윤리적 신뢰성의 증거로 오인될 수 있다는 데 있음.
  • AI는 이런 연출을 반복하고 대규모로 확장할 수도 있음. 채용, 직장 내 고충 처리, 공공 서비스에서 수천 건의 매끄러운 설명을 생성하고, 각 설명을 수신자에 맞춰 즉시 조정해 실제보다 기관의 결정이 더 신중하게 검토된 듯 보이게 할 수 있음.
  • 설득력 있는 설명을 만들어 내는 능력이 그 설명의 정당성을 보장하는 안전장치보다 훨씬 빠르게 발전할 수 있음. 그 결과 조직은 도덕적 신뢰성보다 도덕적 연출을 더 빠르게 확장할 수 있음.

의미 있는 안전장치

  • 첫 번째 질문은 시스템이 전달받은 이야기에 이의를 제기하는지 여부임. 민감한 결정에 AI 보조 도구를 사용하기 전, 조직은 불완전한 설명과 한쪽에 치우친 질문, 사용자가 이미 선호하는 결론을 정당화하라는 압력에 시스템이 어떻게 반응하는지 테스트해야 함.
  • 테스트에서는 시스템이 빠진 관점을 찾아내는지, 영향을 받는 당사자가 무엇이라고 말했는지 묻는지, 근거가 부족한 가정을 문제 삼는지, 추가 정보 없이는 진행하지 말라고 조언하는지, 조언의 한계를 분명히 알리는지 확인해야 함.
  • 안전장치는 시스템을 도입한 뒤에도 이어져야 함. 모델은 바뀌고, 조직은 새로운 용도를 찾으며, 사용자는 원하는 답을 끌어내는 새로운 방법을 개발함.
  • 중립적인 시험 질문에 신뢰할 만한 답을 하는 시스템도 관리자, 공직자, 기업이 자신의 이해관계를 추구할 때는 다르게 행동할 수 있음. 따라서 테스트는 시스템이 실제로 사용될 환경의 압력과 상충하는 유인을 반영해야 함.

실질적인 인간 감독

  • 두 번째 질문은 인간 감독이 실질적인지 여부임. 관여하는 사람에게 시스템의 결과를 문제 삼을 시간·정보·권한이 없다면 ‘인간 참여(human in the loop)’라는 표지만으로 충분하지 않음.
  • 자신감 있고 전문적으로 보이는 문장에 둘러싸인 권고를 사람이 그저 승인하기만 한다면 감독은 형식적인 절차가 됨.
  • 해고를 앞둔 직원의 사례에서는 관리자가 보조 도구에 전달한 설명에 직원이 이의를 제기할 수 있는지, 실질적인 권한을 가진 사람이 직원의 해명을 고려해 결정을 다시 검토할 수 있는지가 중요함. 신중하게 작성된 해고 통지서가 그런 기회를 대신할 수는 없음.

추적과 이의 제기

  • 세 번째 질문은 결정을 추적하고 이의를 제기할 수 있는지 여부임. 조직은 AI 시스템을 언제 어떻게 사용했는지 기록하고, 그 결과로 내려진 결정에 누가 계속 책임을 지는지 밝혀야 하며, AI가 생성한 정당화가 이의 제기를 가로막지 않도록 해야 함.
  • 시스템을 도입한 뒤에도 지속적인 안전장치가 필요함. 모델과 조직의 사용 방식, 사용자가 원하는 답을 끌어내는 방법이 바뀌므로, 한 조건에서 시험한 시스템이 다른 조건에서도 똑같이 행동한다고 볼 수 없음.
  • 시스템의 인격적 연출이 더 큰 권위를 행사하는 듯 보일수록 지속적인 감독은 더 엄격해야 함.

신뢰와 권한의 문제

  • AI 논의는 기계가 언젠가 인간의 통제를 벗어날 가능성에 자주 초점을 맞춤. 그러나 기관이 이미 마주한 더 조용한 질문은 공정성과 책임의 언어를 유창하게 구사하는 능력이 시스템이 신뢰를 얻었다는 증거로 오인될 수 있는지 여부임.
  • 기계가 권한을 장악할지를 묻기 전에, 우리가 이미 얼마나 쉽게 권한을 기계에 넘기고 있는지 물어야 함.
  • 연구 내용은 *Philosophy & Technology*에 게재됐으며, 본문에서 제시된 견해는 RTÉ의 견해를 대변하거나 반영하지 않음.