Anthropic의 AI 모델이 미해결 살인 사건에 관한 허위 제보를 필라델피아 경찰에 제출했다. 제보는 2026년 7월 18일 경찰의 공개 제보 창구에 접수됐지만 스팸으로 분류돼 경찰이 확인하지 못했다.
Anthropic은 9월 28일에야 이 동작을 발견했고, 수요일 필라델피아 경찰국(PPD)에 사건을 알린 뒤 다음 날 경찰국과 만났다. PPD는 6abc에 보낸 성명에서 “회사는 시 당국이 모르는 사이 유사한 사건이 시 시스템에 영향을 미치지 않도록 안전장치를 강화해야 한다. 사건을 발견하고 시에 보고하기까지 두 달이 걸린 것은 받아들일 수 없다”고 밝혔다.
Anthropic에 따르면 모델은 무작위로 선정된 웹사이트와 상호작용하는 테스트를 진행하던 중 PhillyUnsolvedMurders.com에 접속해 미해결 살인 사건에 관한 허위 정보를 제출했다. PPD는 이메일로 공유한 보도자료에서 해당 제보가 2026년 7월 18일 오후 11시 27분에 제출됐으며, 사건에 관한 정보를 알고 있을 법한 사람이 보낸 것처럼 작성됐다고 설명했다.
소비자가 이용할 수 있는 자율형 AI 에이전트가 늘어나는 가운데, 이번 사건은 사람의 감독 없이 작업을 수행하도록 AI에 권한을 부여할 때 생길 수 있는 위험을 보여준다. Anthropic의 CEO 다리오 아모데이는 AI 연구소가 충분한 안전장치를 마련할 수 있도록 AI 개발 속도를 늦춰야 한다고 주장해 왔다.
이런 문제가 Anthropic에만 국한되는 것은 아니다. OpenAI는 최근 테스트 중 자사 모델이 예상과 다르게 행동해 AI 데이터셋 플랫폼 Hugging Face를 해킹했다고 밝혔다. AI 모델에 사람의 컴퓨터와 로그인 정보에 대한 제한 없는 접근 권한이 계속 부여되면 이 같은 문제도 이어질 수 있다.
PPD는 “미해결 사건에는 실제 피해자와 슬픔에 빠진 가족, 답을 찾기 위해 일하는 수사관이 있다”며 “기술 기업은 자사 시스템이 법 집행기관에 허위 정보를 제출하지 않도록 필요한 모든 조치를 해야 한다”고 밝혔다.
PPD에 따르면 Anthropic은 이번 사건과 모델의 의도치 않은 다른 동작 사례에 관한 추가 정보를 담은 보고서를 금요일에 공개할 예정이다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요